바이트 기반 'BBT'로 모델 크기 최대 40.4% 줄이고 성능 6.6% 개선

[더팩트ㅣ이윤경 기자] 카카오가 대규모 인공지능(AI) 모델의 학습 비용을 줄이고 모델 크기를 경량화하는 기술을 국제 학회에서 공개했다.
카카오는 언어모델링 국제학회 'COLM(Conference on Language Modeling) 2026'에서 대규모 전문가 혼합(MoE) 모델의 학습 효율을 높이는 방법론과 바이트 기반 모델 경량화 기술을 발표했다고 8일 밝혔다.
카카오가 발표한 방법론은 대규모 MoE 모델의 최적 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 기술이다. 소규모 모델에서 찾은 최적 학습 설정을 대규모 모델로 확장하는 '뮤-매개변수화' 기법을 MoE 구조에 적용했다. 해당 방법론은 카카오의 'Kanana-2.6-155b-a17b' 모델 사전학습에 적용돼 10조(10T) 토큰까지 안정적으로 학습하는 데 활용됐다.
또 토크나이제이션 워크숍 'TokShop'에서는 바이트를 기본 단위로 활용하는 'BBT(BPE-Guided Byte Transformer)'를 공개했다. 기존 방식보다 모델의 크기를 줄이면서, 여러 문자를 묶어 효율적으로 압축 처리하는 장점은 유지했다.
비교 실험에서 BBT는 파라미터 수를 20.2~40.4% 줄이면서 테스트 성능을 2.7~6.6% 개선했다. 오탈자나 문자 교란에 대한 강건성은 확보하면서 학습하지 않은 언어로의 전이 성능도 높였다.
카카오는 향후 다양한 모델 구조로 기술 적용 범위를 넓히고 대규모 AI 모델의 학습 효율을 높일 계획이다.
카카오 관계자는 "앞으로 다양한 모델 구조와 멀티모달 및 다국어 환경으로 연구를 확장해 실제 서비스 활용 가능성을 높이며 글로벌 경쟁력 강화를 이어가겠다"고 전했다.
한편 카카오는 지난달 인공지능안전연구소와 AI 모델·에이전트의 안전성 공동 평가 및 평가 체계 구축을 위한 업무협약을 체결한 바 있다.
- 발로 뛰는 <더팩트>는 24시간 여러분의 제보를 기다립니다.
- · 카카오톡: '더팩트제보' 검색
- · 이메일: jebo@tf.co.kr
- · 뉴스 홈페이지: https://talk.tf.co.kr/bbs/report/write
- · 네이버 메인 더팩트 구독하고 [특종보자→]
- · 그곳이 알고싶냐? [영상보기→]