카카오, 국제 학회서 AI 효율화 연구 공개…학습·경량화 성과 발표

박상준 기자 (psj96@dailian.co.kr)

입력 2026.10.08 09:46  수정 2026.10.08 09:47
G 구글 검색 선호 출처로 추가 ↗

언어모델링 학회 COLM 2026에서 논문 발표

전체 학습비용 약 1% 수준으로 MoE 최적 학습률 예측…카나나 사전학습 적용

바이트 기반 BBT, 파라미터 최대 40.4% 줄이고 테스트 성능 최대 6.6% 개선


카카오 CI. ⓒ카카오

카카오가 대규모 언어모델의 학습 비용을 줄이고 모델 크기를 경량화하는 AI 연구 성과를 국제 학회에서 공개했다.


카카오는 언어모델링 국제 학회 'COLM 2026'에서 대규모 전문가 혼합(MoE) 모델의 학습 효율을 높이는 방법과 모델 크기를 줄이면서 성능을 개선하는 경량화 기술을 발표했다고 8일 밝혔다.


COLM은 대규모 언어모델(LLM)과 언어모델링을 다루는 국제 학회로 2024년 신설됐다. 카카오는 올해 메인 컨퍼런스와 토크나이제이션 워크숍 'TokShop'에서 각각 논문을 발표했다.


메인 컨퍼런스에서는 대규모 MoE 모델의 최적 학습률을 전체 학습 비용의 약 1% 수준의 계산으로 예측하는 방법론을 소개했다. 학습률은 AI 모델이 학습 과정에서 매개변수를 얼마나 크게 조정할지 결정하는 값으로, 학습 안정성과 성능에 영향을 미친다.


카카오는 소규모 모델에서 찾은 학습 설정을 대규모 모델로 확장하는 '뮤-매개변수화(μ-Parameterization)' 기법을 MoE 구조에 맞게 적용했다. 모델 크기와 학습 토큰량을 단계적으로 늘리며 최적 학습률을 탐색하고, 짧은 학습 구간에서 찾은 설정이 대규모 학습에서도 유효한지 검증했다.


이 방법은 카카오의 'Kanana-2.6-155b-a17b' 모델 사전학습에도 적용됐다. 카카오는 이를 활용해 10조 토큰까지 안정적으로 학습했다고 설명했다.


TokShop에서는 모델 경량화 기술 'BBT: BPE-Guided Byte Transformer'를 공개했다. 기존 BPE 기반 모델보다 작은 단위인 바이트를 활용하면서도 여러 문자를 묶어 처리하는 방식의 장점을 결합한 구조다.


카카오에 따르면 BBT는 비교 실험에서 파라미터 수를 20.2~40.4% 줄이면서 테스트 성능을 2.7~6.6% 높였다. 오탈자나 문자 교란에 대한 대응력과 학습하지 않은 언어로의 전이 성능도 개선됐다.


카카오는 향후 연구를 다양한 모델 구조와 멀티모달·다국어 환경으로 확대하고, 대규모 LLM의 학습 비용을 줄이는 기술을 고도화할 계획이다.


카카오 관계자는 "AI 모델의 성능을 유지하거나 향상시키면서 학습과 운영 비용을 낮출 수 있는 실용적인 해법을 제시했다"며 "실제 서비스 활용 가능성을 높이는 연구를 이어가겠다"고 말했다.

0

0

기사 공유

댓글 쓰기

박상준 기자 (psj96@dailian.co.kr)
기사 모아 보기 >
관련기사

댓글

0 / 150
  • 최신순
  • 찬성순
  • 반대순
0 개의 댓글 전체보기