[イーデイリーLee So-Hyun 記者]Kakao(035720)が、大規模人工知能(AI)モデルの学習コストを削減しつつ安定性を高める最適化技術を公開しました。学習コスト全体の約1%の水準で最適な学習率を予測し、実際に「カナナ(Kanana)」モデルの事前学習に適用しました。また、別の研究では、モデルのサイズを最大40.4%削減しながら、テスト性能を最大6.6%改善しました。
カカオは8日、言語モデリングの国際学会「COLM(Conference on Language Modeling)2026」において、大規模な専門家混合(MoE・Mixture-of-Experts)モデルの学習効率を高める技術と、モデルの軽量化に関する研究成果を発表したと明らかにしました。
COLMは、大規模言語モデル(LLM)と言語モデリングの研究を専門的に扱う国際学会で、2024年に新設されました。カカオは、今回の学会のメインカンファレンスとトークナイゼーション(Tokenization)ワークショップ「TokShop」で、それぞれ研究成果を公開しました。
メインカンファレンスでは、大規模MoEモデルの事前学習に必要な最適学習率を、総学習コストの約1%の水準で予測する方法論を発表しました。
学習率は、AIモデルが学習過程において内部パラメータをどの程度大きく調整するかを決定する値です。高すぎると学習が不安定になる可能性があり、低すぎると学習速度が遅くなる可能性があるため、適切な値を見つける過程が重要です。
MoEモデルは、複数の専門家モジュールの中から入力に必要な一部のみを選択して演算を行う構造であり、最近では高性能なLLMでの活用が増えています。ただし、既存の密接型(Dense)モデルに比べ、学習設定に関する公開研究が相対的に不足しているため、大規模な学習過程において試行錯誤やコスト負担が大きくなる可能性があります。
カカオは、小規模モデルで見出した最適な学習設定を大規模モデルに拡張する「μ-パラメータ化(μ-Parameterization)」の手法を、MoE構造に合わせて適用しました。
モデルの規模と学習トークン量を段階的に増やしながら最適な学習率を探索し、短い学習区間で得られた設定が大規模な学習においても有効であるかを検証しました。
この方法は、カカオの「Kanana-2.6-155b-a17b」モデルの事前学習に実際に適用され、10兆(10T)トークンまで安定して学習を行うために活用されました。
トークナイゼーション・ワークショップ「TokShop」では、モデルのサイズを縮小しつつ性能を向上させる「BBT(BPE-Guided Byte Transformer)」の研究が公開されました。
従来のBPE(Byte Pair Encoding)ベースのモデルは、テキストを単語や単語の断片という形のトークンに分割して処理します。
BBTは、これをさらに小さな基本単位である「バイト(Byte)」ベースの構造に変えつつも、複数の文字を効率的にまとめて処理する従来のBPE方式の長所を維持するように設計されました。
比較実験では、パラメータ数を20.2~40.4%削減しながら、テスト性能を2.7~6.6%向上させました。
誤入力や文字の乱れに対してもより安定した性能を示し、学習していない言語への転移性能も向上したと、カカオは説明しました。
カカオは、BBTを通じてオンデバイス環境におけるモデルのメモリ負荷を軽減し、多言語入力や誤入力が頻発する会話環境においても活用度を高められると見込んでいます。
カカオは今後、研究の適用範囲を多様なモデル構造へと拡大し、マルチモーダルや多言語環境においても効率性を高める方向で技術を高度化していく計画です。
カカオの関係者は、「今回の研究は、AIモデルの性能を維持・向上させつつ、学習および運用コストを削減できる実用的な方法を提示した点に意義がある」とし、「今後は、様々なモデル構造やマルチモーダル・多言語環境へと研究を拡大し、実際のサービスでの活用可能性を高めていきたい」と述べました。
カカオは8日、言語モデリングの国際学会「COLM(Conference on Language Modeling)2026」において、大規模な専門家混合(MoE・Mixture-of-Experts)モデルの学習効率を高める技術と、モデルの軽量化に関する研究成果を発表したと明らかにしました。
COLMは、大規模言語モデル(LLM)と言語モデリングの研究を専門的に扱う国際学会で、2024年に新設されました。カカオは、今回の学会のメインカンファレンスとトークナイゼーション(Tokenization)ワークショップ「TokShop」で、それぞれ研究成果を公開しました。
学習コストの約1%で最適な学習率を予測
メインカンファレンスでは、大規模MoEモデルの事前学習に必要な最適学習率を、総学習コストの約1%の水準で予測する方法論を発表しました。
学習率は、AIモデルが学習過程において内部パラメータをどの程度大きく調整するかを決定する値です。高すぎると学習が不安定になる可能性があり、低すぎると学習速度が遅くなる可能性があるため、適切な値を見つける過程が重要です。
MoEモデルは、複数の専門家モジュールの中から入力に必要な一部のみを選択して演算を行う構造であり、最近では高性能なLLMでの活用が増えています。ただし、既存の密接型(Dense)モデルに比べ、学習設定に関する公開研究が相対的に不足しているため、大規模な学習過程において試行錯誤やコスト負担が大きくなる可能性があります。
カカオは、小規模モデルで見出した最適な学習設定を大規模モデルに拡張する「μ-パラメータ化(μ-Parameterization)」の手法を、MoE構造に合わせて適用しました。
モデルの規模と学習トークン量を段階的に増やしながら最適な学習率を探索し、短い学習区間で得られた設定が大規模な学習においても有効であるかを検証しました。
この方法は、カカオの「Kanana-2.6-155b-a17b」モデルの事前学習に実際に適用され、10兆(10T)トークンまで安定して学習を行うために活用されました。
モデルを40.4%縮小し、性能を最大6.6%向上
トークナイゼーション・ワークショップ「TokShop」では、モデルのサイズを縮小しつつ性能を向上させる「BBT(BPE-Guided Byte Transformer)」の研究が公開されました。
従来のBPE(Byte Pair Encoding)ベースのモデルは、テキストを単語や単語の断片という形のトークンに分割して処理します。
BBTは、これをさらに小さな基本単位である「バイト(Byte)」ベースの構造に変えつつも、複数の文字を効率的にまとめて処理する従来のBPE方式の長所を維持するように設計されました。
比較実験では、パラメータ数を20.2~40.4%削減しながら、テスト性能を2.7~6.6%向上させました。
誤入力や文字の乱れに対してもより安定した性能を示し、学習していない言語への転移性能も向上したと、カカオは説明しました。
カカオは、BBTを通じてオンデバイス環境におけるモデルのメモリ負荷を軽減し、多言語入力や誤入力が頻発する会話環境においても活用度を高められると見込んでいます。
カカオは今後、研究の適用範囲を多様なモデル構造へと拡大し、マルチモーダルや多言語環境においても効率性を高める方向で技術を高度化していく計画です。
カカオの関係者は、「今回の研究は、AIモデルの性能を維持・向上させつつ、学習および運用コストを削減できる実用的な方法を提示した点に意義がある」とし、「今後は、様々なモデル構造やマルチモーダル・多言語環境へと研究を拡大し、実際のサービスでの活用可能性を高めていきたい」と述べました。