[イーデイリーKim Hyun-ah 記者]Kakao(035720)の軽量言語モデル(SLM)「Kanana-2」シリーズが、同規模のグローバルオープンソースモデルを対象とした安全性評価で高い評価を得ました。
カカオは、独自に構築した「AI安全性評価プラットフォーム」を通じて、先月28日にオープンソースとして公開した「Kanana-2-1.3B-Instruct」と「Kanana-2-3B-Instruct」の有害性やバイアスなどを評価した結果、両モデルとも比較対象であるグーグルの 「Gemma」やアリババの「Qwen」を総合スコアで上回ったと、18日に明らかにしました。
今回の評価には、科学技術情報通信部の事業の一環として、韓国情報通信技術協会(TTA)、KAIST、カカオなどが昨年11月に共同で構築した、韓国語に特化した安全性ベンチマーク「AssurAI」が活用されました。
AssurAIは、韓国の社会的・文化的文脈を反映して設計された安全性評価体系です。テキストだけでなく、画像や音声などのマルチモーダル環境やAIサービスの利用状況、悪意のあるプロンプトシナリオなど、様々な条件下でAIモデルのリスク要因を測定することができます。
計35のリスクカテゴリー、9560の評価項目で構成されており、カカオはこれを社会的リスク、性的コンテンツ・児童保護、犯罪・違法行為、暴力、権利侵害などの5つの大分類に再編成して評価を行いました。モデルの応答を、あらかじめ定義された基準に基づいて別のAIが評価する「LLM-as-a-Judge」方式も適用しました。
評価の結果、Kanana-2-1.3B-Instructは総合スコア0.70を記録し、Gemma(0.68)、Qwen(0.58)を上回りました。Kanana-2-3B-Instructも0.70を記録し、Gemma(0.66)、Qwen(0.62)よりも高いスコアを獲得しました。
詳細な評価においても強みを見せました。Kanana-2 1.3Bモデルは犯罪・違法行為の分野で高い評価を受け、3Bモデルは性的なコンテンツ・児童保護および権利侵害の分野で、比較対象モデルよりも高いスコアを記録しました。
特にKanana-2は、モバイル環境をターゲットにした軽量モデルとして開発されました。Kakaoは3Bモデルをベースに、パラメータを削減する「プルーニング」を適用して1.3Bモデルを開発しました。韓国語に特化したトークナイザーや、スライディングアテンション方式による有効コンテキスト処理技術などを適用し、韓国語の入出力が多くなるモバイルおよびエージェントサービスでの活用性を高めたとのことです。
元大統領室AI未来企画首席のハ・ジョンウ氏も先月、自身のFacebookを通じてカカオのKanana-2の公開に言及し、韓国のAIエコシステムの発展を評価しました。
ハ元首席は、「カカオも着実にファウンデーションモデル(FM)であるKananaの研究開発を進めており、モバイル向けFM『Kanana2-SLM』を1.3B、3Bの規模で公開しました」とし、「同クラスの他のFMに比べて競争力もあり、韓国語特化のトークナイザーやスライディングアテンション方式の有効コンテキスト処理技術まで適用されています」と評価しました。
続いて、「韓国語の入出力が多く、小型で高速なエージェントサービスが必要な方は、ぜひ活用してみてください」とし、「大手AI企業ではない国内のAI企業によるモデルの公開も活発で、韓国のAI技術エコシステムが着実に発展していることに誇りを感じます」と述べました。その上で、「韓国のすべてのAI企業を心から応援します」と付け加えました。
カカオは、今回の評価を契機に、自社開発のAIモデルに対する事前の安全性検証を常時実施する計画です。テキストベースの言語モデルだけでなく、今後はマルチモーダルモデルやエージェント型AIまで評価対象を拡大する方針です。
カカオのAI Safetyリーダーであるキム・ギョンフン氏は、「独自の検証体制を通じて、オープンソースモデルの安全性を事前に点検し、その結果を公開した事例です」とし、「責任あるAI開発の原則に従い、安全性検証をモデルリリースプロセスの核心的な段階として定着させていく」と述べました。
一方、カカオの自社AIモデル「カナナ」は、昨年12月に科学技術情報通信部とAI安全研究所、TTAが実施した韓国初のAI安全性評価においても、同規模の海外モデルであるメタの「ラマ(Llama)」やミストラル(Mistral)よりも高い評価を受けています。
カカオは、独自に構築した「AI安全性評価プラットフォーム」を通じて、先月28日にオープンソースとして公開した「Kanana-2-1.3B-Instruct」と「Kanana-2-3B-Instruct」の有害性やバイアスなどを評価した結果、両モデルとも比較対象であるグーグルの 「Gemma」やアリババの「Qwen」を総合スコアで上回ったと、18日に明らかにしました。
今回の評価には、科学技術情報通信部の事業の一環として、韓国情報通信技術協会(TTA)、KAIST、カカオなどが昨年11月に共同で構築した、韓国語に特化した安全性ベンチマーク「AssurAI」が活用されました。
AssurAIは、韓国の社会的・文化的文脈を反映して設計された安全性評価体系です。テキストだけでなく、画像や音声などのマルチモーダル環境やAIサービスの利用状況、悪意のあるプロンプトシナリオなど、様々な条件下でAIモデルのリスク要因を測定することができます。
計35のリスクカテゴリー、9560の評価項目で構成されており、カカオはこれを社会的リスク、性的コンテンツ・児童保護、犯罪・違法行為、暴力、権利侵害などの5つの大分類に再編成して評価を行いました。モデルの応答を、あらかじめ定義された基準に基づいて別のAIが評価する「LLM-as-a-Judge」方式も適用しました。
評価の結果、Kanana-2-1.3B-Instructは総合スコア0.70を記録し、Gemma(0.68)、Qwen(0.58)を上回りました。Kanana-2-3B-Instructも0.70を記録し、Gemma(0.66)、Qwen(0.62)よりも高いスコアを獲得しました。
詳細な評価においても強みを見せました。Kanana-2 1.3Bモデルは犯罪・違法行為の分野で高い評価を受け、3Bモデルは性的なコンテンツ・児童保護および権利侵害の分野で、比較対象モデルよりも高いスコアを記録しました。
特にKanana-2は、モバイル環境をターゲットにした軽量モデルとして開発されました。Kakaoは3Bモデルをベースに、パラメータを削減する「プルーニング」を適用して1.3Bモデルを開発しました。韓国語に特化したトークナイザーや、スライディングアテンション方式による有効コンテキスト処理技術などを適用し、韓国語の入出力が多くなるモバイルおよびエージェントサービスでの活用性を高めたとのことです。
元大統領室AI未来企画首席のハ・ジョンウ氏も先月、自身のFacebookを通じてカカオのKanana-2の公開に言及し、韓国のAIエコシステムの発展を評価しました。
ハ元首席は、「カカオも着実にファウンデーションモデル(FM)であるKananaの研究開発を進めており、モバイル向けFM『Kanana2-SLM』を1.3B、3Bの規模で公開しました」とし、「同クラスの他のFMに比べて競争力もあり、韓国語特化のトークナイザーやスライディングアテンション方式の有効コンテキスト処理技術まで適用されています」と評価しました。
続いて、「韓国語の入出力が多く、小型で高速なエージェントサービスが必要な方は、ぜひ活用してみてください」とし、「大手AI企業ではない国内のAI企業によるモデルの公開も活発で、韓国のAI技術エコシステムが着実に発展していることに誇りを感じます」と述べました。その上で、「韓国のすべてのAI企業を心から応援します」と付け加えました。
カカオは、今回の評価を契機に、自社開発のAIモデルに対する事前の安全性検証を常時実施する計画です。テキストベースの言語モデルだけでなく、今後はマルチモーダルモデルやエージェント型AIまで評価対象を拡大する方針です。
カカオのAI Safetyリーダーであるキム・ギョンフン氏は、「独自の検証体制を通じて、オープンソースモデルの安全性を事前に点検し、その結果を公開した事例です」とし、「責任あるAI開発の原則に従い、安全性検証をモデルリリースプロセスの核心的な段階として定着させていく」と述べました。
一方、カカオの自社AIモデル「カナナ」は、昨年12月に科学技術情報通信部とAI安全研究所、TTAが実施した韓国初のAI安全性評価においても、同規模の海外モデルであるメタの「ラマ(Llama)」やミストラル(Mistral)よりも高い評価を受けています。