[イーデイリーKim Hyun-ah 記者] 科学技術情報通信省の独自AIファウンデーションモデル(ドクパモ)の第2次評価結果が間もなく発表されます。
4つのモデルのうち1つを落選させ、3つのモデルを最終選定する今回の評価において、グローバルAI評価機関であるアーティフィシャル・アナリシス(Artificial Analysis・AA)の総合指標で1位を獲得したモティフが、最終3モデルに選出されるかどうかに注目が集まっています。
ただし、モティフが最終1位となるかどうかは別の問題です。グローバルベンチマークでは競合モデルを大きく上回りましたが、実際のサービス環境で求められる使いやすさ、韓国語の完成度、一般的な会話能力などにおいては、競合モデルが相対的に強みを見せる可能性があるためです。
モティフ3は、AAの人工知能総合指標であるAAIIで47点を獲得し、アップステージ(37点)、SKテレコム(35点)、LG AI研究所(31点)を上回りました。特に、実際の業務遂行能力を評価するGDPval-AA、金融ツールの活用能力を見るτ³-Banking、開発・コーディング能力を評価するTerminal-Benchなど、9つの詳細評価のうち6つで1位を記録しました。 コーディングやエージェントベースの業務遂行など、実務分野でも競争力を示したという評価です。
これを受け、業界では、モティフの最終3モデルへの選出の可能性を高く見ています。ただし、データ学習量の不足による使い勝手の問題が変数として作用し、最終的な1位獲得は容易ではないだろうという見通しも出ています。
◇ベンチマークの逆説…「実戦での使い勝手」が最終順位を左右する
今回の「ドクパモ」評価において、ベンチマークの比重は全体100点のうち40点です。AAIIが25点、韓国知能情報社会振興院(NIA)独自のベンチマークが15点であり、残りは専門家評価35点とユーザー評価25点です。AAIIの点数差が最終結果にそのまま反映されない仕組みとなっています。
実際、先行する評価では、モデルの使い勝手の問題が議論となりました。去る7月、Motifの公開ベータモデルでは、国歌の歌詞のうち「永遠に守り続けましょう」を「永遠に守りhase」と表記したり、一部の歌詞に意味のない英単語が混ざって出てくる事例が確認されました。国歌の第4節でも誤りが続きました。
アップステージの「ソラ・オープン2ベータ」でも、公開テストで国歌の誤りが確認されました。「国歌第4節の斉唱」をリクエストしたところ、実際の国歌とは無関係な内容を新しい歌詞のように生成しました。単なる単語の誤りを超え、質問の意図を誤解し、事実と異なる内容を生成したという点で物議を醸しました。
この2つの事例は、グローバルベンチマークの成績が、実際のサービスにおける韓国語の正確性や事実性とは必ずしも比例しないことを示しています。今回の評価においても、実使用時の安定性が主要な変数となる見通しです。
◇ベンチマックス・データをめぐる論争…「スコア」よりも評価の公平性が変数
ベンチマークをめぐる公平性の議論も変数の一つです。特定のテストセットや評価方式に合わせてモデルを過度に最適化する、いわゆる「ベンチマックス」の問題です。
最近、ネット上では、LG AI研究院の「K-エクサワン」が特定の韓国語テストセットをターゲットにチューニングされたという主張が提起されました。ただし、これはネット上で提起された主張に過ぎず、モデル開発過程における不正行為を意味するものではありません。
モティフについても、AAII関連のデータセット購入をめぐる論争が浮上しました。モティフ側は購入の事実を認めつつも、評価スコアを上げるためのいわゆる「裏工作」を行ったわけではなく、当該データセットが不要な複数の項目で均等に高い成績を収めたことから、問題はないという立場です。
◇「ドクパモ」以降が真の勝負…フロンティアAIへ直行か
業界の注目は、第2次評価の結果を超えて「ドクパモ以降」に向けられています。政府が最終的に3つのモデルを選定した後、追加選抜なしに来年からフロンティア級AI開発プロジェクトへ直行する可能性があることが取り沙汰されているためです。
業界の高官は、「科学技術情報通信部が3つのモデルを選定した後、追加選抜なしにフロンティア級へと移行する方向だと聞きました」とし、「来年、別途プロジェクトを立ち上げるか、選定された3社を中心に進めるかは、検討が必要な部分です」と伝えました。
最終候補の3つのモデルには、GPU 1000枚の提供など、コンピューティングリソースや政府によるR&D支援が継続される可能性が高いです。ただし、フロンティアAIにはコンピューティングだけでなく、クラウド・半導体・データ・サービスの能力も求められるため、最終候補の3社と落選企業、関連産業を網羅する開放型の協力エコシステムが必要だという指摘も出ています。
◇「みんなのAI」まで…モデルを超えたエコシステム競争
政府のAI政策が単一モデルを超え、マルチモデル・マルチエージェント構造を目指す「みんなのAI」へと拡大するにつれ、エコシステム競争も本格化する見通しです。AIモデル企業と通信・プラットフォーム企業間のコンソーシアム競争が予想される中、モティフはKTコンソーシアムにモデル開発会社として参加することを決定しています。
政府の支援が「フロンティアAI」から「みんなのAI」へとつながるにつれ、競争の軸もモデル性能から、コンピューティング・サービス・人材確保の争いへと拡大する見通しです。
第2次評価では、AAIIで1位となったモティフが実用性と韓国語能力まで実証し、最終3社に選出されるか、また、AAII用の学習データを購入していないことが確認されたSKテレコム(017670)とLG(003550)のAI研究所が、最終段階の競争を勝ち抜けるかが注目されています。 ベンチマークの性能を実際のサービス競争力へと転換し、GPU・人材・エコシステムを確保する企業が、「ドクパモ」以降、韓国国内のAI主導権を握る見通しです。
4つのモデルのうち1つを落選させ、3つのモデルを最終選定する今回の評価において、グローバルAI評価機関であるアーティフィシャル・アナリシス(Artificial Analysis・AA)の総合指標で1位を獲得したモティフが、最終3モデルに選出されるかどうかに注目が集まっています。
モティフ3は、AAの人工知能総合指標であるAAIIで47点を獲得し、アップステージ(37点)、SKテレコム(35点)、LG AI研究所(31点)を上回りました。特に、実際の業務遂行能力を評価するGDPval-AA、金融ツールの活用能力を見るτ³-Banking、開発・コーディング能力を評価するTerminal-Benchなど、9つの詳細評価のうち6つで1位を記録しました。 コーディングやエージェントベースの業務遂行など、実務分野でも競争力を示したという評価です。
これを受け、業界では、モティフの最終3モデルへの選出の可能性を高く見ています。ただし、データ学習量の不足による使い勝手の問題が変数として作用し、最終的な1位獲得は容易ではないだろうという見通しも出ています。
今回の「ドクパモ」評価において、ベンチマークの比重は全体100点のうち40点です。AAIIが25点、韓国知能情報社会振興院(NIA)独自のベンチマークが15点であり、残りは専門家評価35点とユーザー評価25点です。AAIIの点数差が最終結果にそのまま反映されない仕組みとなっています。
実際、先行する評価では、モデルの使い勝手の問題が議論となりました。去る7月、Motifの公開ベータモデルでは、国歌の歌詞のうち「永遠に守り続けましょう」を「永遠に守りhase」と表記したり、一部の歌詞に意味のない英単語が混ざって出てくる事例が確認されました。国歌の第4節でも誤りが続きました。
アップステージの「ソラ・オープン2ベータ」でも、公開テストで国歌の誤りが確認されました。「国歌第4節の斉唱」をリクエストしたところ、実際の国歌とは無関係な内容を新しい歌詞のように生成しました。単なる単語の誤りを超え、質問の意図を誤解し、事実と異なる内容を生成したという点で物議を醸しました。
この2つの事例は、グローバルベンチマークの成績が、実際のサービスにおける韓国語の正確性や事実性とは必ずしも比例しないことを示しています。今回の評価においても、実使用時の安定性が主要な変数となる見通しです。
ベンチマークをめぐる公平性の議論も変数の一つです。特定のテストセットや評価方式に合わせてモデルを過度に最適化する、いわゆる「ベンチマックス」の問題です。
最近、ネット上では、LG AI研究院の「K-エクサワン」が特定の韓国語テストセットをターゲットにチューニングされたという主張が提起されました。ただし、これはネット上で提起された主張に過ぎず、モデル開発過程における不正行為を意味するものではありません。
モティフについても、AAII関連のデータセット購入をめぐる論争が浮上しました。モティフ側は購入の事実を認めつつも、評価スコアを上げるためのいわゆる「裏工作」を行ったわけではなく、当該データセットが不要な複数の項目で均等に高い成績を収めたことから、問題はないという立場です。
業界の注目は、第2次評価の結果を超えて「ドクパモ以降」に向けられています。政府が最終的に3つのモデルを選定した後、追加選抜なしに来年からフロンティア級AI開発プロジェクトへ直行する可能性があることが取り沙汰されているためです。
業界の高官は、「科学技術情報通信部が3つのモデルを選定した後、追加選抜なしにフロンティア級へと移行する方向だと聞きました」とし、「来年、別途プロジェクトを立ち上げるか、選定された3社を中心に進めるかは、検討が必要な部分です」と伝えました。
最終候補の3つのモデルには、GPU 1000枚の提供など、コンピューティングリソースや政府によるR&D支援が継続される可能性が高いです。ただし、フロンティアAIにはコンピューティングだけでなく、クラウド・半導体・データ・サービスの能力も求められるため、最終候補の3社と落選企業、関連産業を網羅する開放型の協力エコシステムが必要だという指摘も出ています。
◇「みんなのAI」まで…モデルを超えたエコシステム競争
政府のAI政策が単一モデルを超え、マルチモデル・マルチエージェント構造を目指す「みんなのAI」へと拡大するにつれ、エコシステム競争も本格化する見通しです。AIモデル企業と通信・プラットフォーム企業間のコンソーシアム競争が予想される中、モティフはKTコンソーシアムにモデル開発会社として参加することを決定しています。
政府の支援が「フロンティアAI」から「みんなのAI」へとつながるにつれ、競争の軸もモデル性能から、コンピューティング・サービス・人材確保の争いへと拡大する見通しです。
第2次評価では、AAIIで1位となったモティフが実用性と韓国語能力まで実証し、最終3社に選出されるか、また、AAII用の学習データを購入していないことが確認されたSKテレコム(017670)とLG(003550)のAI研究所が、最終段階の競争を勝ち抜けるかが注目されています。 ベンチマークの性能を実際のサービス競争力へと転換し、GPU・人材・エコシステムを確保する企業が、「ドクパモ」以降、韓国国内のAI主導権を握る見通しです。