[イーデイリーKim Hyun-ah 記者] 政府は、独自のAIファウンデーションモデル(独ファモ)事業に参加した5つの精鋭チームが構築したAI学習データ3544万件を民間へ開放します。大規模な学習データの確保に苦労している国内のAIスタートアップや中小企業、研究者などが、AIハブから無料でダウンロードし、AIモデルの開発やサービスの構築に活用できるようになります。
科学技術情報通信部と韓国知能情報社会振興院(NIA)は、ネイバークラウド、アップステージ、SKTelecom(017670) 、NC AI、LG Corp.(003550) AI研究院が第1次段階評価の過程で構築したAI学習データ29種を、AIハブに公開すると発表しました。
ペ・ギョンフン副総理兼科学技術情報通信部長官が、12月30日午後、ソウル江南区のCOEXオーディトリアムで開催された独自AIファウンデーションプロジェクト発表会で歓迎の挨拶を行っています。写真=ニュース1
公開規模は約3544万件、1.56兆トークン(推定)に達します。大規模な事前学習データだけでなく、推論・エージェント・マルチモーダル・AI安全性データなどが含まれており、AIモデルを新たに開発したり、既存モデルの性能を高めたりする際に活用できます。
特に、アップステージが構築した1兆トークン規模の事前学習データが目を引きます。大規模なAIモデルをゼロから学習させる際に利用でき、知識・知能データやユーザーの嗜好データ、エージェントの行動能力データなどの事後学習データも併せて公開されます。
ネイバークラウドは、公開動画234万件と放送動画52万件をはじめ、動画ベースのテキストや音声データを提供します。動画理解や画像生成など、マルチモーダルAIの開発に活用できます。
SKテレコムは、数学・科学・法律などの専門分野における高難度の推論データや音声・画像データ、韓国型レッドチームングデータ1万件などを公開します。専門AIモデルの推論能力と安全性を高めるために活用できます。
NC AIは、製造技術文書や苦情相談の音声など、実際の産業現場に基づいたデータを提供します。長い文脈の理解や段階的な推論、マルチターン対話、マルチモーダルAIの開発などに活用でき、医療AI関連の画像データも含まれています。
LG AI研究院は、ヒューマノイドロボット向けの「シーン理解(Scene Understanding)」データセットを公開します。韓国の家庭環境に基づいて構築された画像・テキストデータであり、フィジカルAIやビジョン・VLMモデルの開発などに活用できます。
政府は公開に先立ち、NIAと韓国情報通信技術協会(TTA)を通じて、データの品質や個人情報・有害性などを検証し、ライセンス上の制約があるデータは除外しました。
今回の公開は、独自に大規模なデータを確保することが難しいAIスタートアップや中小企業が、モデル開発に必要なデータを確保できる機会になると見られます。事前学習から推論、エージェント、マルチモーダル、安全性に至るまで、多様な用途のデータを活用できるため、研究・開発期間やコストの削減にも役立つ見込みです。
科学技術情報通信部は、第2段階の評価過程で構築されるデータについても、品質検証を経て追加で公開する計画です。 科学技術情報通信部のキム・ギョンマン人工知能政策室長は、「独自のAIファウンデーションモデルプロジェクトは、単にAIモデルの開発にとどまらず、開発過程で蓄積された経験とノウハウを通じて、AIエコシステム全体の質的成長に寄与するという点で大きな意味があります」と述べ、「本日公開されたデータは、精鋭チームのAI学習戦略が込められた貴重な資産であるだけに、AIエコシステムの成長と自立力の強化を牽引する礎となるでしょう」と語りました。
科学技術情報通信部と韓国知能情報社会振興院(NIA)は、ネイバークラウド、アップステージ、SKTelecom(017670) 、NC AI、LG Corp.(003550) AI研究院が第1次段階評価の過程で構築したAI学習データ29種を、AIハブに公開すると発表しました。
公開規模は約3544万件、1.56兆トークン(推定)に達します。大規模な事前学習データだけでなく、推論・エージェント・マルチモーダル・AI安全性データなどが含まれており、AIモデルを新たに開発したり、既存モデルの性能を高めたりする際に活用できます。
特に、アップステージが構築した1兆トークン規模の事前学習データが目を引きます。大規模なAIモデルをゼロから学習させる際に利用でき、知識・知能データやユーザーの嗜好データ、エージェントの行動能力データなどの事後学習データも併せて公開されます。
ネイバークラウドは、公開動画234万件と放送動画52万件をはじめ、動画ベースのテキストや音声データを提供します。動画理解や画像生成など、マルチモーダルAIの開発に活用できます。
SKテレコムは、数学・科学・法律などの専門分野における高難度の推論データや音声・画像データ、韓国型レッドチームングデータ1万件などを公開します。専門AIモデルの推論能力と安全性を高めるために活用できます。
NC AIは、製造技術文書や苦情相談の音声など、実際の産業現場に基づいたデータを提供します。長い文脈の理解や段階的な推論、マルチターン対話、マルチモーダルAIの開発などに活用でき、医療AI関連の画像データも含まれています。
LG AI研究院は、ヒューマノイドロボット向けの「シーン理解(Scene Understanding)」データセットを公開します。韓国の家庭環境に基づいて構築された画像・テキストデータであり、フィジカルAIやビジョン・VLMモデルの開発などに活用できます。
AIハブで無料利用…一部のデータは「安心ゾーン」で提供今回公開されるデータは、AIハブの「独自AIモデルデータ」メニューから、チーム別・データ種類別に検索して確認できます。韓国の企業や研究者、学生などは無料でダウンロードして活用できます。一部のデータは、個人情報保護などのため、別途申請を経てAIハブの「安心ゾーン」で利用できます。
政府は公開に先立ち、NIAと韓国情報通信技術協会(TTA)を通じて、データの品質や個人情報・有害性などを検証し、ライセンス上の制約があるデータは除外しました。
今回の公開は、独自に大規模なデータを確保することが難しいAIスタートアップや中小企業が、モデル開発に必要なデータを確保できる機会になると見られます。事前学習から推論、エージェント、マルチモーダル、安全性に至るまで、多様な用途のデータを活用できるため、研究・開発期間やコストの削減にも役立つ見込みです。
科学技術情報通信部は、第2段階の評価過程で構築されるデータについても、品質検証を経て追加で公開する計画です。 科学技術情報通信部のキム・ギョンマン人工知能政策室長は、「独自のAIファウンデーションモデルプロジェクトは、単にAIモデルの開発にとどまらず、開発過程で蓄積された経験とノウハウを通じて、AIエコシステム全体の質的成長に寄与するという点で大きな意味があります」と述べ、「本日公開されたデータは、精鋭チームのAI学習戦略が込められた貴重な資産であるだけに、AIエコシステムの成長と自立力の強化を牽引する礎となるでしょう」と語りました。