카카오가 8일 언어모델링 국제학회 'COLM 2026'에서 대규모 언어모델(LLM) 학습 비용을 기존의 약 1% 수준으로 낮추는 방법론과 파라미터 20~40%를 줄이는 경량화 기술을 발표했다.
메인 컨퍼런스에서는 대규모 전문가 혼합(MoE) 모델의 최적 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법론을 공개했다. 소규모 모델에서 찾은 최적 설정을 대규모 모델로 확장하는 '뮤-매개변수화' 기법을 MoE 구조에 맞게 적용한 것으로, 카카오의 'Kanana-2.6-155b-a17b' 모델 사전학습에 실제 적용돼 10조 토큰 규모까지 안정적으로 학습을 진행했다.
토크나이제이션 워크숍 'TokShop'에서는 문자를 더 작은 바이트 단위로 쪼개 처리하는 경량화 구조 'BBT'를 공개했다. 비교 실험에서 모델 파라미터 수를 20.2~40.4% 줄이면서 테스트 성능은 2.7~6.6% 개선됐다.
자료




