[イーデイリーKim Hyun-ah 記者] 「独自AIファウンデーションモデル(ドクパモ)」プロジェクトの第2段階評価において、LG Corp.(003550) AI研究所が専門家評価で最高点を獲得したことを受け、AI業界からは評価の根拠をより具体的に公開すべきだという指摘が出ました。
AAIIベンチマークと専門家評価の結果が大きく食い違っているだけに、専門家評価においてどのような技術的要素が高得点につながったのか、評価委員たちがどのような基準で判断したのかを確認できるようにすべきだということです。
科学技術情報通信部は、今回の評価が特定のベンチマークの成績だけで順位を決定する方式ではなく、専門性・使いやすさ・産業的な波及効果などを総合的に評価したと説明しました。
科学技術情報通信部は20日、イ・デイリー紙による問題提起を受け、ドクパモの第2段階評価の基準と結果を追加で公開しました。これによると、35点満点の専門家評価において、LG AI研究院は29.5点を獲得し、4つの精鋭チームの中で最高点を記録しました。4チームの平均は28.75点でした。
一方、グローバルAIベンチマークである人工知能指数(AAII)の評価では、モティフ・テクノロジーズが25点満点中11.9点で1位を占め、LG AI研究所は4チームの中で最下位でした。AAIIの順位は、モティフ・テクノロジーズ、アップステージ、SKテレコム、LG AI研究所の順です。
AAIIで1位だったモティーフ・テクノロジーズは脱落した一方、AAIIで最下位だったLG AI研究院は専門家評価で1位に躍り出たため、評価分野ごとの結果が大きく食い違いました。
AI業界では、結果そのものよりも、評価の過程や判断の根拠を確認できるべきだという声が上がっています。
ある専門家は、「専門家評価において、AIモデルの開発方法論や技術的成果を適切に判断できる専門性を備えた評価委員が参加したかどうかが重要だ」とし、「誰がどのような基準でモデルの技術的成果や開発戦略を評価したのかを確認する必要がある」と述べました。
さらに、「各精鋭チームとの利益相反の問題により、実際のAIモデルの開発や技術を最も深く理解している専門家たちが審査から除外された可能性もある」とし、「そうであるならば、評価委員たちがどのような専門性に基づいて技術的成果を判断したのかを検証する必要がある」と指摘しました。
また別の専門家は、公開されたLG AI研究院の技術資料を根拠に、専門家評価で最高点を獲得した背景について、より具体的に説明する必要があると主張しました。
この専門家は、「LGのテックレポートを見ると、規模は拡大したものの、SFTを適切に行えていません。それならば、何が革新だというのでしょうか」と述べ、「ベンチマーク結果と関連せざるを得ない専門家評価での1位は理解しがたい」と指摘しました。 単にモデルの規模を拡大しただけで、専門家評価において高い技術的評価を得た背景を説明するのは難しいという趣旨です。SFT(Supervised Fine-Tuning)とは、人間が正解を提示したデータを活用し、AIモデルの回答能力をさらに学習させる教師あり微調整の手法です。
評価項目は、開発戦略および技術が10点、開発成果および計画が10点、波及効果および貢献計画が15点など、計35点です。グローバルベンチマークであるAAIIの配点25点よりも高い数値となっています。
開発戦略および技術の項目では、開発技術の優秀性と革新性、技術的な独自性、性能向上の水準、資源の活用および処理効率、安全で信頼性の高いAIモデル開発技術などが評価されました。開発成果および計画、ならびにエコシステム・グローバル波及効果も評価対象に含まれました。
チームごとの点数は、評価委員ごとの点数のうち最高点と最低点を除いた残りの点数を算術平均して算出しました。
ただし、評価委員が具体的にどのような質問を投げかけ、企業がどのように答えたか、どのような技術的要素が高得点につながったかなど、詳細な判断根拠は公開されませんでした。
業界では、評価委員個人の身元の公開まで求めるわけではありませんが、チームごとの詳細な点数や評価項目ごとの点数、主な判断根拠などを公開する必要があると主張しています。
ある専門家は、「開発戦略と技術的成果を評価したのであれば、どのような質問が出され、企業がどのように回答し、評価委員がどのような根拠で点数をつけたのかを確認できるべきだ」とし、「そうでなければ、専門家による評価という名目だけがあり、実際にどのような専門性に基づいて評価されたのかを検証するのは難しい」と述べました。
第2次評価は合計100点満点で、ベンチマーク40点、専門家評価35点、ユーザー評価25点で構成されました。
グローバルAAIIベンチマークでは、モティフ・テクノロジーズが11.9点で1位を占めましたが、NIAベンチマークではSKテレコムが13.4点で最高点を記録しました。AI専門ユーザー評価でもSKテレコムが11.6点で1位となり、一般国民評価ではLG AI研究院が7.6点で最高点を獲得しました。
各評価分野で強みを見せたチームが異なっていたというのが、科学技術情報通信省の説明です。
科学技術情報通信部は、モチーフ・テクノロジーズの脱落に関して、単に活用性が低かっただけでなく、専門性と使いやすさの両面で全体的に点数が低く、「性能が発揮できなかったのは事実」と説明しました。
モティフ・テクノロジーズが強みを見せたグローバル公開ベンチマークに加え、国内環境を反映したNIAベンチマークや専門家評価、実際のユーザー評価などを総合すると、最終結果が異なるのは避けられなかったという説明です。
科学技術情報通信部は、ユーザー評価についても、単なるウェブサイトのデザインやUI・UXではなく、AIモデルが生成するコンテンツの内容と品質を中心に実施したと説明しました。AI専門ユーザー49名と一般国民185名が、実際にAIサービスを利用して評価を行いました。
科学技術情報通信省の立場としては、グローバルベンチマーク一つだけで国家代表AIを選定することはできず、国内環境における性能や技術開発能力、実際の使い勝手、産業的な波及効果などを総合的に考慮しなければならないとしています。
一方、業界の一部では、その趣旨には共感するものの、専門家評価が全体評価の35%を占める以上、LG AI研究院が29.5点を得た具体的な理由や、他のチームとの点数差がどの程度だったのかを確認できるようにすべきだと主張しています。
科学技術情報通信部は、項目別の1位や最高得点、4チームの平均点などを公開しましたが、チーム別の詳細な得点や点数の差までは公開しませんでした。国家予算が投入される国家代表AI選抜の過程であるだけに、単にどのチームが1位になったかというだけでなく、なぜそのような結果になったのかを検証できるレベルの評価情報の公開が必要だとの指摘があります。
AAIIベンチマークと専門家評価の結果が大きく食い違っているだけに、専門家評価においてどのような技術的要素が高得点につながったのか、評価委員たちがどのような基準で判断したのかを確認できるようにすべきだということです。
科学技術情報通信部は、今回の評価が特定のベンチマークの成績だけで順位を決定する方式ではなく、専門性・使いやすさ・産業的な波及効果などを総合的に評価したと説明しました。
科学技術情報通信部は20日、イ・デイリー紙による問題提起を受け、ドクパモの第2段階評価の基準と結果を追加で公開しました。これによると、35点満点の専門家評価において、LG AI研究院は29.5点を獲得し、4つの精鋭チームの中で最高点を記録しました。4チームの平均は28.75点でした。
一方、グローバルAIベンチマークである人工知能指数(AAII)の評価では、モティフ・テクノロジーズが25点満点中11.9点で1位を占め、LG AI研究所は4チームの中で最下位でした。AAIIの順位は、モティフ・テクノロジーズ、アップステージ、SKテレコム、LG AI研究所の順です。
AAIIで1位だったモティーフ・テクノロジーズは脱落した一方、AAIIで最下位だったLG AI研究院は専門家評価で1位に躍り出たため、評価分野ごとの結果が大きく食い違いました。
AI業界では、結果そのものよりも、評価の過程や判断の根拠を確認できるべきだという声が上がっています。
ある専門家は、「専門家評価において、AIモデルの開発方法論や技術的成果を適切に判断できる専門性を備えた評価委員が参加したかどうかが重要だ」とし、「誰がどのような基準でモデルの技術的成果や開発戦略を評価したのかを確認する必要がある」と述べました。
さらに、「各精鋭チームとの利益相反の問題により、実際のAIモデルの開発や技術を最も深く理解している専門家たちが審査から除外された可能性もある」とし、「そうであるならば、評価委員たちがどのような専門性に基づいて技術的成果を判断したのかを検証する必要がある」と指摘しました。
また別の専門家は、公開されたLG AI研究院の技術資料を根拠に、専門家評価で最高点を獲得した背景について、より具体的に説明する必要があると主張しました。
この専門家は、「LGのテックレポートを見ると、規模は拡大したものの、SFTを適切に行えていません。それならば、何が革新だというのでしょうか」と述べ、「ベンチマーク結果と関連せざるを得ない専門家評価での1位は理解しがたい」と指摘しました。 単にモデルの規模を拡大しただけで、専門家評価において高い技術的評価を得た背景を説明するのは難しいという趣旨です。SFT(Supervised Fine-Tuning)とは、人間が正解を提示したデータを活用し、AIモデルの回答能力をさらに学習させる教師あり微調整の手法です。
専門家評価、LGは29.5点…どのような基準で評価されたのか科学技術情報通信部によると、専門家評価には産業界から3名、学界から5名、研究界から2名など、外部専門家10名が参加し、書面評価と質疑応答の方式で行われました。
評価項目は、開発戦略および技術が10点、開発成果および計画が10点、波及効果および貢献計画が15点など、計35点です。グローバルベンチマークであるAAIIの配点25点よりも高い数値となっています。
開発戦略および技術の項目では、開発技術の優秀性と革新性、技術的な独自性、性能向上の水準、資源の活用および処理効率、安全で信頼性の高いAIモデル開発技術などが評価されました。開発成果および計画、ならびにエコシステム・グローバル波及効果も評価対象に含まれました。
チームごとの点数は、評価委員ごとの点数のうち最高点と最低点を除いた残りの点数を算術平均して算出しました。
ただし、評価委員が具体的にどのような質問を投げかけ、企業がどのように答えたか、どのような技術的要素が高得点につながったかなど、詳細な判断根拠は公開されませんでした。
業界では、評価委員個人の身元の公開まで求めるわけではありませんが、チームごとの詳細な点数や評価項目ごとの点数、主な判断根拠などを公開する必要があると主張しています。
ある専門家は、「開発戦略と技術的成果を評価したのであれば、どのような質問が出され、企業がどのように回答し、評価委員がどのような根拠で点数をつけたのかを確認できるべきだ」とし、「そうでなければ、専門家による評価という名目だけがあり、実際にどのような専門性に基づいて評価されたのかを検証するのは難しい」と述べました。
政府「AAIIだけで決定した評価ではない」科学技術情報通信部は、今回の評価が特定のグローバルベンチマークだけで最終順位を決定する方式ではなかったと説明しました。
第2次評価は合計100点満点で、ベンチマーク40点、専門家評価35点、ユーザー評価25点で構成されました。
グローバルAAIIベンチマークでは、モティフ・テクノロジーズが11.9点で1位を占めましたが、NIAベンチマークではSKテレコムが13.4点で最高点を記録しました。AI専門ユーザー評価でもSKテレコムが11.6点で1位となり、一般国民評価ではLG AI研究院が7.6点で最高点を獲得しました。
各評価分野で強みを見せたチームが異なっていたというのが、科学技術情報通信省の説明です。
科学技術情報通信部は、モチーフ・テクノロジーズの脱落に関して、単に活用性が低かっただけでなく、専門性と使いやすさの両面で全体的に点数が低く、「性能が発揮できなかったのは事実」と説明しました。
モティフ・テクノロジーズが強みを見せたグローバル公開ベンチマークに加え、国内環境を反映したNIAベンチマークや専門家評価、実際のユーザー評価などを総合すると、最終結果が異なるのは避けられなかったという説明です。
科学技術情報通信部は、ユーザー評価についても、単なるウェブサイトのデザインやUI・UXではなく、AIモデルが生成するコンテンツの内容と品質を中心に実施したと説明しました。AI専門ユーザー49名と一般国民185名が、実際にAIサービスを利用して評価を行いました。
「なぜこのような結果になったのか」今回の論争は、AAIIで1位だったモティフ・テクノロジーズの脱落や、LG AI研究院が専門家評価で1位になったこと自体よりも、互いに異なる評価で強みを見せたモデルが、どのような基準と配点で総合されたのかを、どれほど透明性を持って説明できるかに焦点が当てられています。
科学技術情報通信省の立場としては、グローバルベンチマーク一つだけで国家代表AIを選定することはできず、国内環境における性能や技術開発能力、実際の使い勝手、産業的な波及効果などを総合的に考慮しなければならないとしています。
一方、業界の一部では、その趣旨には共感するものの、専門家評価が全体評価の35%を占める以上、LG AI研究院が29.5点を得た具体的な理由や、他のチームとの点数差がどの程度だったのかを確認できるようにすべきだと主張しています。
科学技術情報通信部は、項目別の1位や最高得点、4チームの平均点などを公開しましたが、チーム別の詳細な得点や点数の差までは公開しませんでした。国家予算が投入される国家代表AI選抜の過程であるだけに、単にどのチームが1位になったかというだけでなく、なぜそのような結果になったのかを検証できるレベルの評価情報の公開が必要だとの指摘があります。