[イーデイリーPark Jung-Soo 記者] AIモデルの軽量化・最適化を手掛ける企業 #NOTAが、世界的な人工知能(AI)学術会議において、超大規模言語モデル(LLM)の最適化技術力を相次いで認められました。
ノータは25日、自然言語処理(NLP)分野の国際学術会議「EMNLP 2026」において、超大規模AIモデルの最適化に関する論文2編が、それぞれメインカンファレンスと「Findings」に採択されたと発表しました。
今年のEMNLPには約1万8000編の論文が提出され、メインカンファレンスの論文採択率は15.4%を記録しました。EMNLPは、GoogleやMeta、OpenAIなどのグローバルビッグテック企業や主要大学の研究陣が参加し、最新の自然言語処理の研究成果を発表する学術大会です。
今回採択された論文は、GPT系やQwen、Kimiなど、最新のLLMに適用されている「専門家混合モデル(Mixture of Experts・MoE)」の量子化過程で発生する性能低下の問題を取り上げました。
MoEは、入力に応じて必要な専門家のみが演算を行う構造ですが、モデル全体をメモリに保存する必要があるため、実際の動作過程では相当なGPUとメモリを必要とします。量子化を適用すれば必要なリソースを削減できますが、数値の変化により従来とは異なる専門家が選択された場合、モデルの応答性能が低下する可能性があります。
メインカンファレンスで採択された論文は、量子化が後の段階における専門家の選択に及ぼす影響まで反映し、選択境界にある専門家の順序を保持する「MENDS-MoE」という手法を提案しました。3種類のMoEモデルを対象に、4ビットおよび3ビットの量子化実験を行った結果、ほとんどの評価環境において、比較技術よりも高い平均精度と言語モデルの性能を記録しました。
「Findings」に採択された論文は、すべての専門家選択の変化を一律に補正するのではなく、最終的な回答に影響を与える変化に最適化を集中させる「OPERA」という方法論を提案しました。両研究とも、量子化後も適切な専門家選択を維持しつつ、モデルの性能低下を最小限に抑えることに焦点を当てました。
Notaはこれに先立ち、去る7月に開催されたICML 2026の「リソース適応型ファウンデーションモデル推論(AdaptFM)」ワークショップにおける「Efficient Qwen Competition」でも、世界約40チームの中から3位を獲得しました。 オープンソースのLLM「Qwen 3.5-4B」をNVIDIA A10G GPU 1枚で実行しながら、モデルの性能を維持し、従来比で平均6.978倍速い推論速度を実現しました。同ワークショップでは、MoE量子化に関する論文2本も採択されました。
ノータは、研究段階で確立した最適化技術を、超大規模LLMやデータセンターのAIインフラへと拡大適用しています。AIモデルの規模が数千億~数兆個のパラメータへと拡大する中、性能を維持しつつGPUやメモリの使用量を削減する技術が、AIサービスのコスト効率を左右する重要な要素として浮上しているためです。
最近では、1兆個以上のパラメータを持つ「Qwen 3.8 Max」を軽量化し、動作に必要なNVIDIA B300 GPUを24枚から4枚に削減しました。 ムンショットAIの「キミ K3」はB300 GPUを8枚から最大4枚に、アップステージの「ソーラー・オープン2」はH100 GPUを8枚から2枚に削減できる最適化の結果も公開しました。
同社は、モバイル・エッジAIを中心に蓄積してきた最適化能力を、超大規模LLMやデータセンター分野へと拡大する計画です。これまで、プルーニングや量子化の基盤技術から、モバイル・エッジAI、生成AI、ビジョン言語モデル(VLM)、LLMに至るまで、国内外の主要な学会や学術誌で50件余りの研究成果を発表してきました。
ノータのチェ・ミョンス代表は、「AIモデルのパラメータ規模が数千億、数兆単位へと拡大するにつれ、AI産業の競争の軸がモデル自体の性能を超え、運用効率へと移行しつつあります」と述べ、「今後も最新のAIモデルの構造変化に先制的に対応できるよう、研究開発への投資と支援を継続し、AIインフラ導入の効率を高める中核的な最適化技術の適用範囲を広げていきます」と語りました。
ノータは25日、自然言語処理(NLP)分野の国際学術会議「EMNLP 2026」において、超大規模AIモデルの最適化に関する論文2編が、それぞれメインカンファレンスと「Findings」に採択されたと発表しました。
今年のEMNLPには約1万8000編の論文が提出され、メインカンファレンスの論文採択率は15.4%を記録しました。EMNLPは、GoogleやMeta、OpenAIなどのグローバルビッグテック企業や主要大学の研究陣が参加し、最新の自然言語処理の研究成果を発表する学術大会です。
今回採択された論文は、GPT系やQwen、Kimiなど、最新のLLMに適用されている「専門家混合モデル(Mixture of Experts・MoE)」の量子化過程で発生する性能低下の問題を取り上げました。
MoEは、入力に応じて必要な専門家のみが演算を行う構造ですが、モデル全体をメモリに保存する必要があるため、実際の動作過程では相当なGPUとメモリを必要とします。量子化を適用すれば必要なリソースを削減できますが、数値の変化により従来とは異なる専門家が選択された場合、モデルの応答性能が低下する可能性があります。
メインカンファレンスで採択された論文は、量子化が後の段階における専門家の選択に及ぼす影響まで反映し、選択境界にある専門家の順序を保持する「MENDS-MoE」という手法を提案しました。3種類のMoEモデルを対象に、4ビットおよび3ビットの量子化実験を行った結果、ほとんどの評価環境において、比較技術よりも高い平均精度と言語モデルの性能を記録しました。
「Findings」に採択された論文は、すべての専門家選択の変化を一律に補正するのではなく、最終的な回答に影響を与える変化に最適化を集中させる「OPERA」という方法論を提案しました。両研究とも、量子化後も適切な専門家選択を維持しつつ、モデルの性能低下を最小限に抑えることに焦点を当てました。
Notaはこれに先立ち、去る7月に開催されたICML 2026の「リソース適応型ファウンデーションモデル推論(AdaptFM)」ワークショップにおける「Efficient Qwen Competition」でも、世界約40チームの中から3位を獲得しました。 オープンソースのLLM「Qwen 3.5-4B」をNVIDIA A10G GPU 1枚で実行しながら、モデルの性能を維持し、従来比で平均6.978倍速い推論速度を実現しました。同ワークショップでは、MoE量子化に関する論文2本も採択されました。
ノータは、研究段階で確立した最適化技術を、超大規模LLMやデータセンターのAIインフラへと拡大適用しています。AIモデルの規模が数千億~数兆個のパラメータへと拡大する中、性能を維持しつつGPUやメモリの使用量を削減する技術が、AIサービスのコスト効率を左右する重要な要素として浮上しているためです。
最近では、1兆個以上のパラメータを持つ「Qwen 3.8 Max」を軽量化し、動作に必要なNVIDIA B300 GPUを24枚から4枚に削減しました。 ムンショットAIの「キミ K3」はB300 GPUを8枚から最大4枚に、アップステージの「ソーラー・オープン2」はH100 GPUを8枚から2枚に削減できる最適化の結果も公開しました。
同社は、モバイル・エッジAIを中心に蓄積してきた最適化能力を、超大規模LLMやデータセンター分野へと拡大する計画です。これまで、プルーニングや量子化の基盤技術から、モバイル・エッジAI、生成AI、ビジョン言語モデル(VLM)、LLMに至るまで、国内外の主要な学会や学術誌で50件余りの研究成果を発表してきました。
ノータのチェ・ミョンス代表は、「AIモデルのパラメータ規模が数千億、数兆単位へと拡大するにつれ、AI産業の競争の軸がモデル自体の性能を超え、運用効率へと移行しつつあります」と述べ、「今後も最新のAIモデルの構造変化に先制的に対応できるよう、研究開発への投資と支援を継続し、AIインフラ導入の効率を高める中核的な最適化技術の適用範囲を広げていきます」と語りました。