[イーデイリーKim Hyun-ah 記者] 科学技術情報通信部(ペ・ギョンフン長官)は、「独自AIファウンデーションモデル(ドクパモ)」の第2次段階評価の結果をめぐる論争に関連し、評価基準と方式の公正性と透明性を強調しました。
特に、今回の評価は政府が一方的に定めた基準に基づいて行われたものではなく、AI技術の急速な変化に合わせて6ヶ月ごとに評価目標と基準を調整する「ムービング・ターゲット」方式で運営され、第2次評価の基準も4つの精鋭チームと数回にわたり協議を重ねて策定されたというのが、科学技術情報通信省の説明です。
ペ・ギョンフン副総理兼科学技術情報通信部長官。写真=ニュース1
グローバル市場で信頼されているAAIIベンチマークにおいて、参加企業中1位、世界10位を記録したモティフ・テクノロジーズが第2次審査で脱落した後、詳細な点数の公開を要求し、他の精鋭チームもこれに同意したことを受け、科学技術情報通信部はこれまで公開していなかった項目別の点数まで、27日夜に公開しました。
科学技術情報通信部は、「『ドクパモ』は単なる順位競争や脱落チームの選定を目的とするものではなく、韓国のAI企業が競争を超えて成長し、国内のAIエコシステムの質的成長と拡大を牽引することにその趣旨がある」と明らかにしました。
また、「評価結果の公開に伴う一部企業への予期せぬ直接的・間接的な被害を最小限に抑える一方、評価過程・結果に対する公正性と透明性という価値もバランスよく考慮し、結果の公開範囲については慎重を期してきた」と説明しました。
科学技術情報通信部は、AI技術の急速な進化を考慮し、6ヶ月ごとにAIモデルの開発目標を変更する「ムービング・ターゲット」方式を適用していると明らかにしました。これに伴い、段階評価の基準や方式も、その都度、精鋭チームとの協議を経て策定するというものです。
今回の第2次段階評価は、△ベンチマーク評価40点、△専門家評価35点、△ユーザー評価25点など、計100点で行われました。
ベンチマーク評価は、グローバルAI評価プラットフォームであるアーティフィシャル・アナリシス(Artificial Analysis)のAAII評価25点と、韓国知能情報社会振興院(NIA)の評価15点で構成されました。専門家評価では、開発戦略・技術、開発成果・計画、波及効果・貢献計画などが評価され、ユーザー評価にはAI専門ユーザーと一般国民による評価が含まれました。
最終スコアは、SKTelecom(017670) が70.6点、アップステージが69.9点、LG Corp.(003550) AI研究院が69.0点、モティフが65.8点となりました。これにより、SKテレコム・アップステージ・LG AI研究院の3つの精鋭チームが次の段階に進出し、モティフは脱落しました。
詳細を見ると、評価項目ごとの結果は大きく分かれました。グローバルベンチマークであるAAIIでは、モティフが11.9点で1位を占めました。一方、専門家評価ではLG AI研究所が29.5点で1位となり、AI専門ユーザー評価ではSKテレコムが11.6点、一般国民評価ではLG AI研究所が7.6点で、それぞれ最も高い点数を獲得しました。
科学技術情報通信部は、今回の第2次評価の基準と方式について、「精鋭チームと数回にわたり協議を重ねて策定し、評価前に最終案を公式に案内した結果、精鋭チームから異論はなく、これを基に評価を進めました」と明らかにしました。
第1次評価と比較して、評価体系も変更されました。グローバルな信頼性の高いAAIIを新たに導入し、専門家評価では開発戦略だけでなく、実際の開発成果や国内外のエコシステムへの波及効果に対する評価の比重を拡大し、一般国民による評価も新たに追加したというのが科学技術情報通信部の説明です。
科学技術情報通信部はこれについて、「段階評価は、単に精鋭チーム間の競争を通じて絞り込み・選別することにあるのではなく、政府が評価基準を積極的に設計・進化させることで、精鋭チームによるグローバル水準のAIモデル開発能力の強化、独自のAIモデルを国内のAIエコシステムへの現場適用・普及、国民の視点に合致するAIモデルの開発などを誘導したという点で意義がある」と明らかにしました。
専門家評価には、産業界から3名、学界から5名、研究界から2名など、外部専門家10名が参加しました。精鋭チームが提出した評価書類をもとに、書面評価と質疑応答を行い、委員ごとの評価点数の中から最高点・最低点を除いた残りの点数を算術平均して、最終点数を算出しました。
ユーザー評価も、選抜チーム間の相対評価ではなく、絶対評価として行われました。AI専門ユーザー49名と一般国民185名が各モデルを直接使用した後、1~5点で評価しました。
科学技術情報通信部は、「単純なAIモデルが示す性能にとどまらず、実際に多様なユーザーがAIモデルを直接使用して体感する使いやすさや有効性まで、総合的に評価するために設けました」と明らかにしました。
ただし、今回の評価では、グローバルな性能を測定するAAIIで1位を獲得した「Motif」が、専門家・ユーザー評価で相対的に低い点数を受け、最終的に脱落したという点から、評価の配点や方式が結果に与えた影響に関する議論は残る見通しです。
科学技術情報通信部は、脱落したモティフの技術力そのものについては肯定的に評価しました。モティフの「Motif 3」がAAIIにおいて、米国・中国以外の国が開発したAIモデルの中で最も高い性能を記録し、エージェント・コーディングなどの高難度ベンチマークにおいて、世界のビッグテック企業に匹敵する水準を示したと説明しました。
科学技術情報通信部は、「モティフ・テクノロジーズの精鋭チームは、AAIIにおいて米国・中国以外の国が開発したAIモデルの中で世界最高の性能を記録し、エージェント・コーディングなどの高難度ベンチマーク分野で、世界のトップクラスのビッグテック企業に匹敵する高い水準を披露するなど、独自のAIモデル開発分野で有意義な成果を示したことから、今後も国内のAIエコシステムに多角的に貢献することが期待されます」と明らかにしました。
次の段階に進出した3つの精鋭チームには、高性能GPUの支援も拡大します。B200基準のGPU支援規模は、昨年下半期の約500枚から今年上半期には768枚の水準に増え、今年下半期には1000枚の水準まで拡大する計画です。これは、SKテレコム、アップステージ、LG AI研究院にそれぞれ400億ウォンの予算が支援されることになります。
科学技術情報通信部は、最近、AIモデルの競争が米国と中国を中心に激化し、AIモデルが国家安全保障と産業競争力を左右する戦略資産として浮上している状況を考慮し、最上位クラスの独自AIモデル開発に向けた新たな支援体制についても関係省庁と協議を進めています。
科学技術情報通信部は、「最高水準の独自AIモデル開発の必要性を深く認識しており、従来の方式を超える新たな支援体制について関係省庁と協議中であり、今後、具体的な内容を準備して発表する計画です」と明らかにしました。
特に、今回の評価は政府が一方的に定めた基準に基づいて行われたものではなく、AI技術の急速な変化に合わせて6ヶ月ごとに評価目標と基準を調整する「ムービング・ターゲット」方式で運営され、第2次評価の基準も4つの精鋭チームと数回にわたり協議を重ねて策定されたというのが、科学技術情報通信省の説明です。
グローバル市場で信頼されているAAIIベンチマークにおいて、参加企業中1位、世界10位を記録したモティフ・テクノロジーズが第2次審査で脱落した後、詳細な点数の公開を要求し、他の精鋭チームもこれに同意したことを受け、科学技術情報通信部はこれまで公開していなかった項目別の点数まで、27日夜に公開しました。
科学技術情報通信部は、「『ドクパモ』は単なる順位競争や脱落チームの選定を目的とするものではなく、韓国のAI企業が競争を超えて成長し、国内のAIエコシステムの質的成長と拡大を牽引することにその趣旨がある」と明らかにしました。
また、「評価結果の公開に伴う一部企業への予期せぬ直接的・間接的な被害を最小限に抑える一方、評価過程・結果に対する公正性と透明性という価値もバランスよく考慮し、結果の公開範囲については慎重を期してきた」と説明しました。
科学技術情報通信部は、AI技術の急速な進化を考慮し、6ヶ月ごとにAIモデルの開発目標を変更する「ムービング・ターゲット」方式を適用していると明らかにしました。これに伴い、段階評価の基準や方式も、その都度、精鋭チームとの協議を経て策定するというものです。
今回の第2次段階評価は、△ベンチマーク評価40点、△専門家評価35点、△ユーザー評価25点など、計100点で行われました。
ベンチマーク評価は、グローバルAI評価プラットフォームであるアーティフィシャル・アナリシス(Artificial Analysis)のAAII評価25点と、韓国知能情報社会振興院(NIA)の評価15点で構成されました。専門家評価では、開発戦略・技術、開発成果・計画、波及効果・貢献計画などが評価され、ユーザー評価にはAI専門ユーザーと一般国民による評価が含まれました。
最終スコアは、SKTelecom(017670) が70.6点、アップステージが69.9点、LG Corp.(003550) AI研究院が69.0点、モティフが65.8点となりました。これにより、SKテレコム・アップステージ・LG AI研究院の3つの精鋭チームが次の段階に進出し、モティフは脱落しました。
詳細を見ると、評価項目ごとの結果は大きく分かれました。グローバルベンチマークであるAAIIでは、モティフが11.9点で1位を占めました。一方、専門家評価ではLG AI研究所が29.5点で1位となり、AI専門ユーザー評価ではSKテレコムが11.6点、一般国民評価ではLG AI研究所が7.6点で、それぞれ最も高い点数を獲得しました。
科学技術情報通信部は、今回の第2次評価の基準と方式について、「精鋭チームと数回にわたり協議を重ねて策定し、評価前に最終案を公式に案内した結果、精鋭チームから異論はなく、これを基に評価を進めました」と明らかにしました。
第1次評価と比較して、評価体系も変更されました。グローバルな信頼性の高いAAIIを新たに導入し、専門家評価では開発戦略だけでなく、実際の開発成果や国内外のエコシステムへの波及効果に対する評価の比重を拡大し、一般国民による評価も新たに追加したというのが科学技術情報通信部の説明です。
科学技術情報通信部はこれについて、「段階評価は、単に精鋭チーム間の競争を通じて絞り込み・選別することにあるのではなく、政府が評価基準を積極的に設計・進化させることで、精鋭チームによるグローバル水準のAIモデル開発能力の強化、独自のAIモデルを国内のAIエコシステムへの現場適用・普及、国民の視点に合致するAIモデルの開発などを誘導したという点で意義がある」と明らかにしました。
専門家評価には、産業界から3名、学界から5名、研究界から2名など、外部専門家10名が参加しました。精鋭チームが提出した評価書類をもとに、書面評価と質疑応答を行い、委員ごとの評価点数の中から最高点・最低点を除いた残りの点数を算術平均して、最終点数を算出しました。
ユーザー評価も、選抜チーム間の相対評価ではなく、絶対評価として行われました。AI専門ユーザー49名と一般国民185名が各モデルを直接使用した後、1~5点で評価しました。
科学技術情報通信部は、「単純なAIモデルが示す性能にとどまらず、実際に多様なユーザーがAIモデルを直接使用して体感する使いやすさや有効性まで、総合的に評価するために設けました」と明らかにしました。
ただし、今回の評価では、グローバルな性能を測定するAAIIで1位を獲得した「Motif」が、専門家・ユーザー評価で相対的に低い点数を受け、最終的に脱落したという点から、評価の配点や方式が結果に与えた影響に関する議論は残る見通しです。
科学技術情報通信部は、脱落したモティフの技術力そのものについては肯定的に評価しました。モティフの「Motif 3」がAAIIにおいて、米国・中国以外の国が開発したAIモデルの中で最も高い性能を記録し、エージェント・コーディングなどの高難度ベンチマークにおいて、世界のビッグテック企業に匹敵する水準を示したと説明しました。
科学技術情報通信部は、「モティフ・テクノロジーズの精鋭チームは、AAIIにおいて米国・中国以外の国が開発したAIモデルの中で世界最高の性能を記録し、エージェント・コーディングなどの高難度ベンチマーク分野で、世界のトップクラスのビッグテック企業に匹敵する高い水準を披露するなど、独自のAIモデル開発分野で有意義な成果を示したことから、今後も国内のAIエコシステムに多角的に貢献することが期待されます」と明らかにしました。
次の段階に進出した3つの精鋭チームには、高性能GPUの支援も拡大します。B200基準のGPU支援規模は、昨年下半期の約500枚から今年上半期には768枚の水準に増え、今年下半期には1000枚の水準まで拡大する計画です。これは、SKテレコム、アップステージ、LG AI研究院にそれぞれ400億ウォンの予算が支援されることになります。
科学技術情報通信部は、最近、AIモデルの競争が米国と中国を中心に激化し、AIモデルが国家安全保障と産業競争力を左右する戦略資産として浮上している状況を考慮し、最上位クラスの独自AIモデル開発に向けた新たな支援体制についても関係省庁と協議を進めています。
科学技術情報通信部は、「最高水準の独自AIモデル開発の必要性を深く認識しており、従来の方式を超える新たな支援体制について関係省庁と協議中であり、今後、具体的な内容を準備して発表する計画です」と明らかにしました。