[イーデイリーKim Hyun-ah 記者] グローバルベンチマーク機関であるアーティフィシャル・アナリシスのAIモデル評価(AAII)で、韓国国内1位、世界10位を獲得していたモティフ・テクノロジーズが、独自のAIファウンデーションモデルプロジェクト(ドクパモ)の第2段階評価で脱落した理由が具体的に公開されました。
モティフはグローバルベンチマークでは最高得点を獲得しましたが、NIAベンチマークや専門家評価、実際のユーザー評価では、SKTelecom(017670)やLG Corp.(003550) AI研究院に及ばなかったとのことです。
科学技術情報通信省の高官は、イーデイリーとの電話取材で、モティフの脱落について「単に実用性が低かっただけでなく、専門性と使いやすさの両面で全体的に点数が低かった」とし、「性能が振るわなかったのは事実だ」と説明しました。
科学技術情報通信部は20日、「ドクパモ」の第2次段階評価の詳細な評価基準と、項目別の1位企業を公開しました。最近の評価結果発表以降、詳細な点数を公開していなかったため、評価の透明性をめぐる議論が起きたことを受け、第1次段階評価と同様の水準で、評価項目別の1位と点数を公開したものです。
今回の評価は合計100点満点で、ベンチマーク40点、専門家評価35点、ユーザー評価25点で構成されました。
最も注目されるのは、評価領域ごとに1位が異なったという点です。AAIIグローバルベンチマークではモティフ、NIAベンチマークおよびAI専門ユーザー評価ではSKテレコム、専門家評価と一般国民評価ではLG AI研究院がそれぞれ1位を占めました。
グローバルAAIIベンチマークの25点では、モティフが11.9点で1位となりました。一方、NIAベンチマークの15点では、SKテレコムが13.4点で最高点を記録しました。
専門家評価の35点では、LG AI研究所が29.5点で1位となりました。AI専門ユーザー評価の15点では、SKテレコムが11.6点で最も高く、一般国民評価の10点では、LG AI研究所が7.6点で1位を記録しました。
モティフが強みを見せたのはグローバル公開ベンチマークでしたが、国内独自のベンチマークや専門家および実際のユーザー評価では、SKテレコムとLG AI研究所が先行しました。
科学技術情報通信省の高官は、モティフの評価結果について、「活用性の問題ではなく、専門性と使いやすさの両方がやや劣っていた」とし、「性能が伸びなかったのは事実ですが、点数の差はそれほど大きくありません」と述べました。
モティフはAAIIで11.9点を獲得し、25点満点基準で最高点を記録しましたが、NIAベンチマークではSKテレコムが13.4点で1位を占めました。
NIAのベンチマークは、数学、知識、長文理解、安全性、信頼性、韓国語、指示実行など7つの分野を評価します。グローバルに公開されている指標だけでは把握しにくい、国内環境におけるモデルの性能を別途検証したものです。
専門家評価においても、モティーフはLG AI研究所に後れをとりました。専門家評価では、産業界から3名、学界から5名、研究界から2名など、外部専門家が約5日間にわたり書面評価と質疑応答を行い、開発戦略や技術、開発成果と計画、エコシステムへの波及効果および貢献計画などを評価しました。
特に、35点のうち10点が開発戦略および技術に割り当てられました。これには、開発技術の優秀性と革新性、技術的独自性、性能向上の水準、資源活用および処理効率、安全で信頼性の高いAIモデル開発技術などが含まれました。
残りの10点は開発成果と計画に、15点はエコシステム・グローバル波及効果に割り当てられました。
LG AI研究所は、この専門家評価で29.5点を獲得し、1位を記録しました。4つの精鋭チームの平均は28.75点でした。
ユーザー評価においても、モティーフは1位を獲得できませんでした。AIスタートアップの代表などで構成されたAI専門ユーザー評価では、SKテレコムが11.6点で1位となり、一般国民による評価ではLG AI研究所が7.6点で最も高得点でした。
科学技術情報通信部は、ユーザー評価において単にウェブサイトのデザインやUI・UXを評価したのではなく、AIモデルが生成するコンテンツの内容と品質を中心に評価するよう指導したと説明しました。
AI専門ユーザー49名と一般市民185名が、実際のAIサービスを利用して絶対評価方式で点数を付けました。
このような結果は、今回の評価が特定のベンチマーク性能だけで最終順位を決定しなかったことを示しています。グローバルベンチマークでモティフが1位を占めたとしても、国内の性能検証、専門家による技術・事業性の評価、実際のユーザー評価をすべて合算した最終結果では、脱落する可能性のある仕組みだったということです。
科学技術情報通信部は、今回の第2次評価において、独自性の最低基準についても別途点検しました。技術的・政策的・倫理的な側面から、独自のAIモデルとしての基準を満たしているかどうかも評価対象に含めました。
モティーフについては、新規参加チームである点を考慮し、エコシステムへの波及効果の評価において、既存のAIモデルの現場への普及実績や計画まで含めました。既存の3つの精鋭チームについては、独自のAIモデルと派生モデルの現場への普及実績・計画を評価したのに対し、モティーフについては、既存のAIモデルの現場への普及実績や計画まで含めて評価したというのが、科学技術情報通信省の説明です。
[生成AIで作成]
モティフはグローバルベンチマークでは最高得点を獲得しましたが、NIAベンチマークや専門家評価、実際のユーザー評価では、SKTelecom(017670)やLG Corp.(003550) AI研究院に及ばなかったとのことです。
科学技術情報通信省の高官は、イーデイリーとの電話取材で、モティフの脱落について「単に実用性が低かっただけでなく、専門性と使いやすさの両面で全体的に点数が低かった」とし、「性能が振るわなかったのは事実だ」と説明しました。
科学技術情報通信部は20日、「ドクパモ」の第2次段階評価の詳細な評価基準と、項目別の1位企業を公開しました。最近の評価結果発表以降、詳細な点数を公開していなかったため、評価の透明性をめぐる議論が起きたことを受け、第1次段階評価と同様の水準で、評価項目別の1位と点数を公開したものです。
今回の評価は合計100点満点で、ベンチマーク40点、専門家評価35点、ユーザー評価25点で構成されました。
最も注目されるのは、評価領域ごとに1位が異なったという点です。AAIIグローバルベンチマークではモティフ、NIAベンチマークおよびAI専門ユーザー評価ではSKテレコム、専門家評価と一般国民評価ではLG AI研究院がそれぞれ1位を占めました。
グローバルAAIIベンチマークの25点では、モティフが11.9点で1位となりました。一方、NIAベンチマークの15点では、SKテレコムが13.4点で最高点を記録しました。
専門家評価の35点では、LG AI研究所が29.5点で1位となりました。AI専門ユーザー評価の15点では、SKテレコムが11.6点で最も高く、一般国民評価の10点では、LG AI研究所が7.6点で1位を記録しました。
モティフが強みを見せたのはグローバル公開ベンチマークでしたが、国内独自のベンチマークや専門家および実際のユーザー評価では、SKテレコムとLG AI研究所が先行しました。
科学技術情報通信省の高官は、モティフの評価結果について、「活用性の問題ではなく、専門性と使いやすさの両方がやや劣っていた」とし、「性能が伸びなかったのは事実ですが、点数の差はそれほど大きくありません」と述べました。
モティフはAAIIで11.9点を獲得し、25点満点基準で最高点を記録しましたが、NIAベンチマークではSKテレコムが13.4点で1位を占めました。
NIAのベンチマークは、数学、知識、長文理解、安全性、信頼性、韓国語、指示実行など7つの分野を評価します。グローバルに公開されている指標だけでは把握しにくい、国内環境におけるモデルの性能を別途検証したものです。
専門家評価においても、モティーフはLG AI研究所に後れをとりました。専門家評価では、産業界から3名、学界から5名、研究界から2名など、外部専門家が約5日間にわたり書面評価と質疑応答を行い、開発戦略や技術、開発成果と計画、エコシステムへの波及効果および貢献計画などを評価しました。
特に、35点のうち10点が開発戦略および技術に割り当てられました。これには、開発技術の優秀性と革新性、技術的独自性、性能向上の水準、資源活用および処理効率、安全で信頼性の高いAIモデル開発技術などが含まれました。
残りの10点は開発成果と計画に、15点はエコシステム・グローバル波及効果に割り当てられました。
LG AI研究所は、この専門家評価で29.5点を獲得し、1位を記録しました。4つの精鋭チームの平均は28.75点でした。
ユーザー評価においても、モティーフは1位を獲得できませんでした。AIスタートアップの代表などで構成されたAI専門ユーザー評価では、SKテレコムが11.6点で1位となり、一般国民による評価ではLG AI研究所が7.6点で最も高得点でした。
科学技術情報通信部は、ユーザー評価において単にウェブサイトのデザインやUI・UXを評価したのではなく、AIモデルが生成するコンテンツの内容と品質を中心に評価するよう指導したと説明しました。
AI専門ユーザー49名と一般市民185名が、実際のAIサービスを利用して絶対評価方式で点数を付けました。
このような結果は、今回の評価が特定のベンチマーク性能だけで最終順位を決定しなかったことを示しています。グローバルベンチマークでモティフが1位を占めたとしても、国内の性能検証、専門家による技術・事業性の評価、実際のユーザー評価をすべて合算した最終結果では、脱落する可能性のある仕組みだったということです。
科学技術情報通信部は、今回の第2次評価において、独自性の最低基準についても別途点検しました。技術的・政策的・倫理的な側面から、独自のAIモデルとしての基準を満たしているかどうかも評価対象に含めました。
モティーフについては、新規参加チームである点を考慮し、エコシステムへの波及効果の評価において、既存のAIモデルの現場への普及実績や計画まで含めました。既存の3つの精鋭チームについては、独自のAIモデルと派生モデルの現場への普及実績・計画を評価したのに対し、モティーフについては、既存のAIモデルの現場への普及実績や計画まで含めて評価したというのが、科学技術情報通信省の説明です。