[イーデイリーKim Hyun-ah 記者] 韓国における「AI国家代表」選抜戦である独自AIファウンデーションモデル事業(ドクパモ)に参加した4社のグローバルAI評価結果が公開されました。モティフ・テクノロジーズの「Motif 3」が47点で最も高く、アップステージが37点、SKTelecom(017670) が35点、LG Corp.(003550) AI研究院が31点の順となりました。
グローバル評価機関が同一の基準で国内のAIモデルを比較したという点で意義がありますが、AAIIスコアだけでモデルの総合的な競争力や実際の活用能力を判断するには限界があるという指摘も出ています。
特に、AIが単純な質疑応答を超え、複雑な業務を自ら遂行するエージェントAIへと発展するにつれ、既存のベンチマークが実際の業務能力をどの程度反映できるかが、新たな評価課題として浮上しています。
アップステージの「Solar Open 2 250B」が37点で2位、SKテレコムの「A.X K2」が35点で3位、LG AI研究院の「K-EXAONE 2.0 0803」が31点で続きました。
AAIIは、数学・科学・コーディング・推論など、さまざまな分野の評価結果を総合し、AIモデルの性能を1つのスコアで示す指標です。今回の評価では、金融業務、コーディング、科学・数学の問題、長文推論、情報の正確性などを評価する9つの項目が活用されました。
Motif 3は、グローバルな大規模言語モデル(LLM)の中で10位、OpenWeightモデルの中では4位にランクインしました。特に、金融業務を行うAIエージェントやコーディング能力を評価する一部の項目で強みを見せました。
Motif社はこの日、Motif 3のモデル重みだけでなく、学習コードやライブラリまで公開し、モデルエコシステムの拡大にも乗り出しました。
第3次評価では、LG AI研究所、アップステージ、SKテレコム、モティフ・テクノロジーズなど4社のうち1社が脱落することになります。
「ドクパモ」評価におけるベンチマーク分野は計40点で、このうちAAIIが25点、韓国知能情報社会振興院(NIA)の独自ベンチマークが15点を占めます。残りの60点は、専門家評価35点とユーザー評価25点で構成されています。
AAIIが全体評価の25%を占めるだけに、今回の点数差が最終結果に相当な影響を与える可能性があります。しかし、AAIIが「ドクパモ」の最終順位を決定するわけではありません。
特に、NIAの非公開評価や専門家・ユーザー評価が残っているため、AAIIの順位が「ドクパモ」の最終順位と必ずしも一致するとは言い切れません。
国家AI戦略委員会の技術革新・インフラ分科会の委員の一人は、「アーティフィシャル・アナリシス(Artificial Analysis)のような評価は、複数のモデルの性能を迅速に比較できるという点で意義がある」としつつも、「現在の評価方法だけでエージェントAIの実際の業務遂行能力をすべて評価するには限界がある」と述べました。
これは、AIが単に質問に答えるレベルを超え、何度も対話を続け、ウェブサイトや参考資料を検索して情報を確認した後、実際の業務を遂行する段階へと発展しているからです。
同委員は、「エージェントAIは、一つの業務を遂行する過程においても、複数の段階にわたる推論と実行が必要だ」とし、「既存のベンチマークだけでは、こうした複合的な能力を十分に評価することは難しい」と説明しました。
実際の業務遂行能力を評価するには、問題解決の過程全体を確認する必要があるため、評価に必要な時間とコストも大きくなります。このため、現在は複数のモデルの性能を迅速に比較できる既存のベンチマークが広く活用されていますが、実際のAIサービス環境とは差異が生じる可能性があるという説明です。
ただし、「AAIIが無意味な指標だというわけではありません」とし、「複数のモデルの性能を同一の基準で比較できるという点では有用ですが、エージェントAI時代のモデル性能を示す唯一の指標として捉えてはなりません」と述べました。
SKテレコムは、「AAIIはドクパモ評価基準の一部であり、専門家評価やユーザー評価も残っている」とし、「単一の指標だけでモデルの完成度を代表するのは難しいという点を考慮してほしい」と明らかにしました。
さらに、「モデルの競争力は指標だけでなく、実際の活用環境における性能・コスト・安定性が合わせて評価されるべきだ」とし、「指標上、補完が必要な領域は改善しつつ、実際の使用環境における性能向上も並行して進める計画だ」と明らかにしました。
アップステージもまた、「AAIIのベンチマーク結果が無意味というわけではありませんが、これをモデル性能の絶対的な基準と見なしてはなりません」と述べました。
しかし、AAIIのスコアだけでモデルの総合的な競争力を判断するには、明らかな限界があります。AAIIは複数の評価結果を1つのスコアに総合する指標であるため、どのような評価項目を含めるかによって結果が異なる可能性があります。韓国語能力や特定産業における業務遂行能力、実際のサービスにおけるコスト・速度・安定性なども、1つのスコアだけでは十分に示すことは困難です。
実際、アーティフィシャル・アナリシスも、総合知能指数以外にも、モデルの応答速度、利用コスト、コーディングエージェントの性能など、様々な指標を別途提供しています。これは、一つの総合スコアだけではAIモデルのすべての競争力を説明することは難しいという意味です。
現在確認されているグローバル評価順位は、モティーフが1位、アップステージが2位、SKテレコムが3位、LG AI研究院が4位です。しかし、この順位がそのまま「ドクパモ」の最終順位を意味するわけではありません。
AAIIの25点にNIA評価の15点、さらに専門家・ユーザー評価が加わるため、最終結果で順位が変わる可能性もあります。
今回のAAIIの結果は、韓国国内のAIモデルの相対的な性能を測ることができる重要な参考指標であるという意味合いが強くあります。ただし、AIが実際の産業やサービスの現場で活用されるためには、ベンチマークスコアだけでなく、業務遂行能力やコスト、速度、安定性なども併せて検討する必要があります。
ドクパモ第3次評価の最終的な注目点は、やはり「AAIIの1位は誰か」という枠を超え、グローバルベンチマークの成績と実際のAI活用能力をどのように総合的に評価するかという点に焦点が当てられる見通しです。
グローバル評価機関が同一の基準で国内のAIモデルを比較したという点で意義がありますが、AAIIスコアだけでモデルの総合的な競争力や実際の活用能力を判断するには限界があるという指摘も出ています。
特に、AIが単純な質疑応答を超え、複雑な業務を自ら遂行するエージェントAIへと発展するにつれ、既存のベンチマークが実際の業務能力をどの程度反映できるかが、新たな評価課題として浮上しています。
モティフが47点で1位…アップステージ・SKT・LGが続く13日、グローバルAI分析機関であるアーティフィシャル・アナリシス(Artificial Analysis)が公開した「Artificial Analysis Intelligence Index(AAII)v4.1.1」によると、モティフの「Motif 3」は47点を記録しました。
アップステージの「Solar Open 2 250B」が37点で2位、SKテレコムの「A.X K2」が35点で3位、LG AI研究院の「K-EXAONE 2.0 0803」が31点で続きました。
AAIIは、数学・科学・コーディング・推論など、さまざまな分野の評価結果を総合し、AIモデルの性能を1つのスコアで示す指標です。今回の評価では、金融業務、コーディング、科学・数学の問題、長文推論、情報の正確性などを評価する9つの項目が活用されました。
Motif 3は、グローバルな大規模言語モデル(LLM)の中で10位、OpenWeightモデルの中では4位にランクインしました。特に、金融業務を行うAIエージェントやコーディング能力を評価する一部の項目で強みを見せました。
Motif社はこの日、Motif 3のモデル重みだけでなく、学習コードやライブラリまで公開し、モデルエコシステムの拡大にも乗り出しました。
AAIIの25点を反映…「ドクパモ」の最終順位とは別です今回の結果が注目される理由は、科学技術情報通信省の「ドクパモ」第3次評価と直接結びついているためです。
第3次評価では、LG AI研究所、アップステージ、SKテレコム、モティフ・テクノロジーズなど4社のうち1社が脱落することになります。
「ドクパモ」評価におけるベンチマーク分野は計40点で、このうちAAIIが25点、韓国知能情報社会振興院(NIA)の独自ベンチマークが15点を占めます。残りの60点は、専門家評価35点とユーザー評価25点で構成されています。
AAIIが全体評価の25%を占めるだけに、今回の点数差が最終結果に相当な影響を与える可能性があります。しかし、AAIIが「ドクパモ」の最終順位を決定するわけではありません。
特に、NIAの非公開評価や専門家・ユーザー評価が残っているため、AAIIの順位が「ドクパモ」の最終順位と必ずしも一致するとは言い切れません。
「AAII、エージェントAIの実務能力評価には限界」今回の結果について、専門家はAAIIの有用性を認めつつも、評価方式の限界を指摘しました。
国家AI戦略委員会の技術革新・インフラ分科会の委員の一人は、「アーティフィシャル・アナリシス(Artificial Analysis)のような評価は、複数のモデルの性能を迅速に比較できるという点で意義がある」としつつも、「現在の評価方法だけでエージェントAIの実際の業務遂行能力をすべて評価するには限界がある」と述べました。
これは、AIが単に質問に答えるレベルを超え、何度も対話を続け、ウェブサイトや参考資料を検索して情報を確認した後、実際の業務を遂行する段階へと発展しているからです。
同委員は、「エージェントAIは、一つの業務を遂行する過程においても、複数の段階にわたる推論と実行が必要だ」とし、「既存のベンチマークだけでは、こうした複合的な能力を十分に評価することは難しい」と説明しました。
実際の業務遂行能力を評価するには、問題解決の過程全体を確認する必要があるため、評価に必要な時間とコストも大きくなります。このため、現在は複数のモデルの性能を迅速に比較できる既存のベンチマークが広く活用されていますが、実際のAIサービス環境とは差異が生じる可能性があるという説明です。
ただし、「AAIIが無意味な指標だというわけではありません」とし、「複数のモデルの性能を同一の基準で比較できるという点では有用ですが、エージェントAI時代のモデル性能を示す唯一の指標として捉えてはなりません」と述べました。
アップステージ・SKT「単一の指標でモデルの完成度を判断するのは難しい」AAIIでモティフに後れを取ったアップステージとSKテレコムも、AAIIのスコアだけでモデルの
完成度を判断すべきではないという立場です。LG AI研究所は別途の立場を表明しませんでした。
SKテレコムは、「AAIIはドクパモ評価基準の一部であり、専門家評価やユーザー評価も残っている」とし、「単一の指標だけでモデルの完成度を代表するのは難しいという点を考慮してほしい」と明らかにしました。
さらに、「モデルの競争力は指標だけでなく、実際の活用環境における性能・コスト・安定性が合わせて評価されるべきだ」とし、「指標上、補完が必要な領域は改善しつつ、実際の使用環境における性能向上も並行して進める計画だ」と明らかにしました。
アップステージもまた、「AAIIのベンチマーク結果が無意味というわけではありませんが、これをモデル性能の絶対的な基準と見なしてはなりません」と述べました。
「AAII 1位」がドクパモの最終1位につながるのか? 今回のAAIIの結果は、韓国のAIモデルを同一のグローバル基準で比較したという点で意義があります。特に、モティーフ3がグローバルモデルと比較して高いスコア(10位)を記録したことは、韓国のAI業界においても注目すべき成果として評価されています。
しかし、AAIIのスコアだけでモデルの総合的な競争力を判断するには、明らかな限界があります。AAIIは複数の評価結果を1つのスコアに総合する指標であるため、どのような評価項目を含めるかによって結果が異なる可能性があります。韓国語能力や特定産業における業務遂行能力、実際のサービスにおけるコスト・速度・安定性なども、1つのスコアだけでは十分に示すことは困難です。
実際、アーティフィシャル・アナリシスも、総合知能指数以外にも、モデルの応答速度、利用コスト、コーディングエージェントの性能など、様々な指標を別途提供しています。これは、一つの総合スコアだけではAIモデルのすべての競争力を説明することは難しいという意味です。
現在確認されているグローバル評価順位は、モティーフが1位、アップステージが2位、SKテレコムが3位、LG AI研究院が4位です。しかし、この順位がそのまま「ドクパモ」の最終順位を意味するわけではありません。
AAIIの25点にNIA評価の15点、さらに専門家・ユーザー評価が加わるため、最終結果で順位が変わる可能性もあります。
今回のAAIIの結果は、韓国国内のAIモデルの相対的な性能を測ることができる重要な参考指標であるという意味合いが強くあります。ただし、AIが実際の産業やサービスの現場で活用されるためには、ベンチマークスコアだけでなく、業務遂行能力やコスト、速度、安定性なども併せて検討する必要があります。
ドクパモ第3次評価の最終的な注目点は、やはり「AAIIの1位は誰か」という枠を超え、グローバルベンチマークの成績と実際のAI活用能力をどのように総合的に評価するかという点に焦点が当てられる見通しです。