[イーデイリーKim Hyun-ah 記者] 韓国における「AI国家代表」選抜戦である独自AIファウンデーションモデル事業(ドクパモ)に参加した4つのモデルのうち、モティフの「Motif 3」が、グローバルな人工知能(AI)評価機関であるアーティフィシャル・アナリシス(Artificial Analysis)の最新評価で最高得点を獲得したことが明らかになりました。
13日、アーティフィシャル・アナリシスによると、最新の「Artificial Analysis Intelligence Index v4.1.1」において、「Motif 3」は47点を記録しました。 続いて、アップステージの「Solar Open2 250B」が37点、SKTelecom(017670)の「A.X-K2」が35点、LG Corp.(003550) AI研究院の「K-EXAONE 2.0 0803」が31点と続きました。
アーティフィシャル・アナリシスは、AIモデルの数学・科学・コーディング・推論など、多様な能力を総合的に評価するグローバルなAI分析機関です。最新のIntelligence Indexは、GDPval-AA v2、τ³-Banking、Terminal-Bench 2.1、SciCode、Humanity’s Last Exam、GPQA Diamondなど、9つの評価を総合してスコアを算出しています。
科学技術情報通信部が委託した「独自AIファウンデーションモデル」審査に関するAAII性能評価表。出典=アーティフィシャル・アナリシス
一方、独自AIファウンデーションモデル(独ファモ)プロジェクトの第3次評価結果の発表を控える中、グローバルベンチマークであるAAIIのスコアが最終審査に相当な影響を与える見通しです。今回の第3次評価では、LG AI研究院、アップステージ、SKテレコム、モティフ・テクノロジーズなど4社のうち1社が脱落することになります。
AAIIスコアは、独パモ第2次評価のベンチマーク40点のうち25点を占めるものとされています。残りの15点は、韓国知能情報社会振興院(NIA)独自のベンチマークが反映されます。全体100点のうちAAIIの比重が25%に達するため、最終順位に相当な影響を与えると見込まれています。
AAIIは、推論・知識・コーディングなど、実際のAI活用能力を評価するグローバルベンチマークです。科学技術情報通信部の関係者は、「通常、AAIIの評価は各企業が依頼しますが、今回は政府がアーティフィシャル・アナリシスに直接依頼し、スコアが公開されました」と述べました。
13日、アーティフィシャル・アナリシスによると、最新の「Artificial Analysis Intelligence Index v4.1.1」において、「Motif 3」は47点を記録しました。 続いて、アップステージの「Solar Open2 250B」が37点、SKTelecom(017670)の「A.X-K2」が35点、LG Corp.(003550) AI研究院の「K-EXAONE 2.0 0803」が31点と続きました。
アーティフィシャル・アナリシスは、AIモデルの数学・科学・コーディング・推論など、多様な能力を総合的に評価するグローバルなAI分析機関です。最新のIntelligence Indexは、GDPval-AA v2、τ³-Banking、Terminal-Bench 2.1、SciCode、Humanity’s Last Exam、GPQA Diamondなど、9つの評価を総合してスコアを算出しています。
一方、独自AIファウンデーションモデル(独ファモ)プロジェクトの第3次評価結果の発表を控える中、グローバルベンチマークであるAAIIのスコアが最終審査に相当な影響を与える見通しです。今回の第3次評価では、LG AI研究院、アップステージ、SKテレコム、モティフ・テクノロジーズなど4社のうち1社が脱落することになります。
AAIIスコアは、独パモ第2次評価のベンチマーク40点のうち25点を占めるものとされています。残りの15点は、韓国知能情報社会振興院(NIA)独自のベンチマークが反映されます。全体100点のうちAAIIの比重が25%に達するため、最終順位に相当な影響を与えると見込まれています。
AAIIは、推論・知識・コーディングなど、実際のAI活用能力を評価するグローバルベンチマークです。科学技術情報通信部の関係者は、「通常、AAIIの評価は各企業が依頼しますが、今回は政府がアーティフィシャル・アナリシスに直接依頼し、スコアが公開されました」と述べました。