[イーデイリーKim Hyun-ah 記者] 政府が「独自人工知能(AI)ファウンデーションモデル(ドクパモ)」プロジェクトの第2次段階評価の詳細な点数を電撃的に公開しました。モティフ・テクノロジーズが評価結果の詳細公開を要請し、他の精鋭チームもこれに同意したためです。
今回の公開結果では、SKTelecom(017670)が70.6点で総合1位を獲得し、アップステージ(69.9点)、LG AI研究所(69.0点)、モティフ・テクノロジーズ(65.8点)の順となりました。
特にモティフは、グローバルAI評価機関であるアーティフィシャル・アナリシス(Artificial Analysis)のAAIIベンチマークでは、4つの精鋭チームの中で最も高い得点を獲得しましたが、専門家評価やAI専門ユーザーによる評価、一般市民による評価では、いずれも4位にとどまったことが明らかになりました。
政府は当初、評価結果の公開に伴う企業への直接的・間接的な被害を最小限に抑えつつ、評価過程の公正性と透明性を確保するため、公開範囲を慎重に決定してきたと述べました。
しかし、同日、モティフ・テクノロジーズが声明文を通じて詳細な評価結果の公開を要請し、他の精鋭チームもこれに同意したことから、全体の詳細な点数を公開することにしました。
科学技術情報通信部は、「ドクパモは単なる順位競争や脱落チームの選定を目的とした事業ではない」とし、「国内のAI企業が競争を超えて成長し、AIエコシステムの質的成長と拡大を牽引することに趣旨がある」と明らかにしました。
ベンチマーク評価はさらに、△AAIIベンチマーク △韓国知能情報社会振興院(NIA)ベンチマークに分けられました。ユーザー評価は、△AI専門ユーザーによる評価 △一般国民による評価で構成されました。
全体の配点は、ベンチマーク40点、専門家評価35点、ユーザー評価25点など、計100点です。
科学技術情報通信部は、AI技術が急速に変化している点を考慮し、6ヶ月ごとに開発目標を調整する「ムービングターゲット」方式を適用しています。これに伴い、段階評価の基準や方式についても、その都度、精鋭チームと協議して策定していると説明しました。
今回の第2次評価基準も、精鋭チームと数回にわたり協議を経て確定し、評価前に最終案を公式に案内した上で、異論がない状態で評価を実施したというのが政府の説明です。
Artificial Analysisが6月末に公表した基準を適用して実施されたAAIIベンチマークにおいて、モティフは原点数47.4点で1位を記録しました。これを25点満点に換算した結果、11.9点を獲得しました。
アップステージは原点数37.4点、換算点数9.4点で2位となり、SKテレコムは35.0点、8.8点で3位でした。LG AI研究院は31.0点、7.8点で4位でした。
モティーフは、GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、AA-LCR、AA-Omniscience Accuracy、HLEなど、多数の項目で比較的高い得点を記録しました。特にTerminal-Bench v2.1では74.9点を獲得し、他の3チームを大きく引き離しました。
NIAの評価は、数学、知識、長文理解、指示遂行、韓国語、信頼性、安全性、社会的安全性など、8つの領域を対象に行われました。
原点数基準では、アップステージが732.4点で最も高く、SKテレコムが728.7点、LG AI研究院が705.8点、モティフが702.8点でした。これを15点満点に換算しました。
詳細を見ると、アップステージは数学・指示実行・信頼性などで強みを見せ、SKテレコムは知識や韓国語などで高い得点を記録しました。LG AI研究所は長文理解と安全性で比較的高い得点を獲得しました。
専門家評価は、産業界3名、学界5名、研究界2名など、外部専門家10名で評価委員会を構成して行われました。精鋭チームが提出した評価書類をもとに、約5日間にわたり書面評価と質疑応答(Q&A)を並行して実施しました。
評価項目は、△開発戦略および技術10点、△開発成果および計画10点、△波及効果および貢献計画15点でした。独自性の最低基準に関する点検も併せて行われました。
評価委員ごとの点数を単純にすべて合算するのではなく、最高点と最低点を除いた残りの点数を算術平均して、最終点数を算出しました。
LG AI研究院は、開発戦略と技術、開発成果および計画、波及効果および貢献計画の全般において、均等に高い評価を受けたことが分かりました。
一方、モティフは一部の評価委員から高い点数を得ましたが、全体としては27.1点にとどまりました。
LG AI研究所が11.3点で2位、アップステージが10.8点で3位、モティフが8.4点で4位でした。
科学技術情報通信部は、AI専門の評価委員について、AIに関する専門的な知見と経験を備え、実際に様々なAI開発過程においてAIモデルを幅広く活用してきたAIスタートアップの代表者を対象に選定したと説明しました。
当初は50名が選定されましたが、実際の評価には49名が参加しました。利益相反の有無についても確認しました。
評価は、各精鋭チームが提供したAI利用ウェブサイトに基づき、使いやすさなどを評価する方式で行われました。評価団は1点から5点までの点数を付け、これを15点満点に換算しました。
原点数の合計は、SKテレコムが189点で最も高く、LG AI研究院が184点、アップステージが176点、モティフが137点でした。
政府は一般国民の代表性を高めるため、十分な期間にわたって評価団を募集した後、国内の住民登録人口統計を基準に性別・年齢別の割当枠を設定し、無作為に200名を選定しました。このうち、実際に評価に参加した人数は185名でした。
評価団もまた、利益相反の有無を確認した上で確定されました。各モデルに対し、1~5点の絶対評価を実施し、これを10点満点に換算しました。
原点の合計は、LG AI研究院が701点、SKテレコムが698点、アップステージが675点、モティフが528点でした。
これに対し、モティフはユーザー評価の公正性に異議を唱えています。有名な大企業と、比較的認知度の低いスタートアップが開発したモデルを一般ユーザーが評価する場合、開発会社を事前に知っていれば、ブランド認知度や先入観が結果に影響を与える可能性を排除するのは難しいという理由からです。
モティフ・テクノロジーズは、「AAIIベンチマークで示された性能の差が、一般ユーザー評価では大きく異なっていた場合、どのような評価方式や条件がこうした結果に影響を与えたのか、納得のいく説明が必要です」と主張しました。
また、ユーザー評価の詳細な結果は、単に選定と落選を分ける資料にとどまるべきではなく、参加企業がモデルの使いやすさを改善できる実質的なフィードバックとして提供されるべきだと強調しました。
アップステージが69.9点で2位、LG AI研究所が69.0点で3位、モティフ・テクノロジーズが65.8点で4位となりました。
結果として、モティフは全体100点中24.6点を獲得し、ベンチマーク評価では1位となりました。しかし、専門家評価で27.1点、ユーザー評価で14.1点を得たため、最終順位では4位に下がりました。
一方、SKテレコムはAAIIでは3位でしたが、NIAで1位、専門家評価で2位、AI専門ユーザーによる評価で1位、一般国民による評価で2位を記録し、総合1位となりました。
アップステージもまた、ベンチマーク評価で2位、専門家評価で3位、ユーザー評価で3位を記録し、69.9点で2位となりました。
LG Corp.(003550) AI研究院は、AAIIでは4位でしたが、専門家評価と一般国民評価でそれぞれ1位を獲得し、最終的に3位となりました。
科学技術情報通信部は、今回の詳細結果の公開を機に、企業が単なる点数や順位に固執するのではなく、それぞれの技術力と能力を基に、国内外のAIエコシステムに貢献してほしいと強調しました。
科学技術情報通信部の関係者は、「韓国企業が保有する潜在力と能力を基に、国内外のAIエコシステムに幅広く貢献し、新しく競争力のあるAI企業が絶えず挑戦する、ダイナミックなエコシステムへと発展していくことを期待しています」と述べました。
今回の公開結果では、SKTelecom(017670)が70.6点で総合1位を獲得し、アップステージ(69.9点)、LG AI研究所(69.0点)、モティフ・テクノロジーズ(65.8点)の順となりました。
特にモティフは、グローバルAI評価機関であるアーティフィシャル・アナリシス(Artificial Analysis)のAAIIベンチマークでは、4つの精鋭チームの中で最も高い得点を獲得しましたが、専門家評価やAI専門ユーザーによる評価、一般市民による評価では、いずれも4位にとどまったことが明らかになりました。
モティーフの要請を受け詳細スコアを公開…「公正性と透明性のバランスを考慮」科学技術情報通信部(副総理兼長官 ペ・ギョンフン)は27日、「ドクパモ」プロジェクトの第2段階評価結果の詳細スコアを公開しました。
政府は当初、評価結果の公開に伴う企業への直接的・間接的な被害を最小限に抑えつつ、評価過程の公正性と透明性を確保するため、公開範囲を慎重に決定してきたと述べました。
しかし、同日、モティフ・テクノロジーズが声明文を通じて詳細な評価結果の公開を要請し、他の精鋭チームもこれに同意したことから、全体の詳細な点数を公開することにしました。
科学技術情報通信部は、「ドクパモは単なる順位競争や脱落チームの選定を目的とした事業ではない」とし、「国内のAI企業が競争を超えて成長し、AIエコシステムの質的成長と拡大を牽引することに趣旨がある」と明らかにしました。
5つの領域の評価…ベンチマーク・専門家・ユーザー評価を並行して実施「ドクパモ」の第2次段階評価は、大きく分けて△ベンチマーク評価 △専門家評価 △ユーザー評価の順で行われました。
ベンチマーク評価はさらに、△AAIIベンチマーク △韓国知能情報社会振興院(NIA)ベンチマークに分けられました。ユーザー評価は、△AI専門ユーザーによる評価 △一般国民による評価で構成されました。
全体の配点は、ベンチマーク40点、専門家評価35点、ユーザー評価25点など、計100点です。
科学技術情報通信部は、AI技術が急速に変化している点を考慮し、6ヶ月ごとに開発目標を調整する「ムービングターゲット」方式を適用しています。これに伴い、段階評価の基準や方式についても、その都度、精鋭チームと協議して策定していると説明しました。
今回の第2次評価基準も、精鋭チームと数回にわたり協議を経て確定し、評価前に最終案を公式に案内した上で、異論がない状態で評価を実施したというのが政府の説明です。
AAIIではモティーフが1位…47.4点の原点数最も注目されるのはAAIIの評価です。
Artificial Analysisが6月末に公表した基準を適用して実施されたAAIIベンチマークにおいて、モティフは原点数47.4点で1位を記録しました。これを25点満点に換算した結果、11.9点を獲得しました。
アップステージは原点数37.4点、換算点数9.4点で2位となり、SKテレコムは35.0点、8.8点で3位でした。LG AI研究院は31.0点、7.8点で4位でした。
モティーフは、GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、AA-LCR、AA-Omniscience Accuracy、HLEなど、多数の項目で比較的高い得点を記録しました。特にTerminal-Bench v2.1では74.9点を獲得し、他の3チームを大きく引き離しました。
NIAベンチマークはSKTが1位…4チームの点数差はそれほど大きくありませんNIAベンチマークでは、SKテレコムが13.4点で最も高かった。アップステージが13.3点で続き、LG AI研究院が12.8点、モティフが12.7点の順でした。
NIAの評価は、数学、知識、長文理解、指示遂行、韓国語、信頼性、安全性、社会的安全性など、8つの領域を対象に行われました。
原点数基準では、アップステージが732.4点で最も高く、SKテレコムが728.7点、LG AI研究院が705.8点、モティフが702.8点でした。これを15点満点に換算しました。
詳細を見ると、アップステージは数学・指示実行・信頼性などで強みを見せ、SKテレコムは知識や韓国語などで高い得点を記録しました。LG AI研究所は長文理解と安全性で比較的高い得点を獲得しました。
専門家評価ではLG AI研究院が1位…モティフは27.1点で4位 専門家評価では、LG AI研究院が29.5点で1位となりました。SKテレコムが29.3点、アップステージが29.1点、モティフが27.1点の順でした。
専門家評価は、産業界3名、学界5名、研究界2名など、外部専門家10名で評価委員会を構成して行われました。精鋭チームが提出した評価書類をもとに、約5日間にわたり書面評価と質疑応答(Q&A)を並行して実施しました。
評価項目は、△開発戦略および技術10点、△開発成果および計画10点、△波及効果および貢献計画15点でした。独自性の最低基準に関する点検も併せて行われました。
評価委員ごとの点数を単純にすべて合算するのではなく、最高点と最低点を除いた残りの点数を算術平均して、最終点数を算出しました。
LG AI研究院は、開発戦略と技術、開発成果および計画、波及効果および貢献計画の全般において、均等に高い評価を受けたことが分かりました。
一方、モティフは一部の評価委員から高い点数を得ましたが、全体としては27.1点にとどまりました。
AIスタートアップの代表49名を評価…SKTが1位、モティフが4位AI専門ユーザーによる評価では、SKテレコムが11.6点で1位を記録しました。
LG AI研究所が11.3点で2位、アップステージが10.8点で3位、モティフが8.4点で4位でした。
科学技術情報通信部は、AI専門の評価委員について、AIに関する専門的な知見と経験を備え、実際に様々なAI開発過程においてAIモデルを幅広く活用してきたAIスタートアップの代表者を対象に選定したと説明しました。
当初は50名が選定されましたが、実際の評価には49名が参加しました。利益相反の有無についても確認しました。
評価は、各精鋭チームが提供したAI利用ウェブサイトに基づき、使いやすさなどを評価する方式で行われました。評価団は1点から5点までの点数を付け、これを15点満点に換算しました。
原点数の合計は、SKテレコムが189点で最も高く、LG AI研究院が184点、アップステージが176点、モティフが137点でした。
一般市民による評価でもLG AI研究院が1位…モティフは5.7点一般
市民による評価では、LG AI研究院が7.6点で1位となりました。SKテレコムは7.5点、アップステージは7.3点、モティフは5.7点でした。
政府は一般国民の代表性を高めるため、十分な期間にわたって評価団を募集した後、国内の住民登録人口統計を基準に性別・年齢別の割当枠を設定し、無作為に200名を選定しました。このうち、実際に評価に参加した人数は185名でした。
評価団もまた、利益相反の有無を確認した上で確定されました。各モデルに対し、1~5点の絶対評価を実施し、これを10点満点に換算しました。
原点の合計は、LG AI研究院が701点、SKテレコムが698点、アップステージが675点、モティフが528点でした。
これに対し、モティフはユーザー評価の公正性に異議を唱えています。有名な大企業と、比較的認知度の低いスタートアップが開発したモデルを一般ユーザーが評価する場合、開発会社を事前に知っていれば、ブランド認知度や先入観が結果に影響を与える可能性を排除するのは難しいという理由からです。
モティフ・テクノロジーズは、「AAIIベンチマークで示された性能の差が、一般ユーザー評価では大きく異なっていた場合、どのような評価方式や条件がこうした結果に影響を与えたのか、納得のいく説明が必要です」と主張しました。
また、ユーザー評価の詳細な結果は、単に選定と落選を分ける資料にとどまるべきではなく、参加企業がモデルの使いやすさを改善できる実質的なフィードバックとして提供されるべきだと強調しました。
総合1位はSKT…モティフはAAIIで1位ながら全体では4位でした。 5つの評価領域をすべて合算した結果、SKテレコムが70.6点で最終1位を獲得しました。
アップステージが69.9点で2位、LG AI研究所が69.0点で3位、モティフ・テクノロジーズが65.8点で4位となりました。
結果として、モティフは全体100点中24.6点を獲得し、ベンチマーク評価では1位となりました。しかし、専門家評価で27.1点、ユーザー評価で14.1点を得たため、最終順位では4位に下がりました。
一方、SKテレコムはAAIIでは3位でしたが、NIAで1位、専門家評価で2位、AI専門ユーザーによる評価で1位、一般国民による評価で2位を記録し、総合1位となりました。
アップステージもまた、ベンチマーク評価で2位、専門家評価で3位、ユーザー評価で3位を記録し、69.9点で2位となりました。
LG Corp.(003550) AI研究院は、AAIIでは4位でしたが、専門家評価と一般国民評価でそれぞれ1位を獲得し、最終的に3位となりました。
科学技術情報通信部は、今回の詳細結果の公開を機に、企業が単なる点数や順位に固執するのではなく、それぞれの技術力と能力を基に、国内外のAIエコシステムに貢献してほしいと強調しました。
科学技術情報通信部の関係者は、「韓国企業が保有する潜在力と能力を基に、国内外のAIエコシステムに幅広く貢献し、新しく競争力のあるAI企業が絶えず挑戦する、ダイナミックなエコシステムへと発展していくことを期待しています」と述べました。