Konoe Intelligence、機械論的解釈可能性を活用したLLM向けガードレール技術で特許取得

AI安全性を専門とする研究開発企業のKonoe Intelligenceは、機械論的解釈可能性の知見を活用したLLM(大規模言語モデル)向けガードレールの実装方法について特許を取得した。
同技術は、LLMの生成過程における内部表現(隠れ状態)を直接検査することで、有害な出力を検出・制御するもの。モデルの重みを変更せず、既存のLLMに追加実装できる点が特徴となっている。
同社による比較評価では、NVIDIAの安全性判定モデル「Llama-3.1-Nemotron-Safety-Guard-8B(NemoGuard)」に対し、有害コンテンツのブロック率で84.1%を達成。NemoGuardの83.0%を上回った。一方、検査レイテンシは0.18ミリ秒で、NemoGuardの59.5ミリ秒に対して約330分の1となった。
従来の「LLM-as-a-Judge」型のガードレールや専用分類器では、生成済みテキストを別のモデルなどで判定するため、追加の推論による遅延やコストが課題となっていた。今回の技術では、生成中のモデル内部の表現を検査することで、高速な安全性判定を実現する。
技術面では、学習済みモデルの隠れ状態空間に安全性の境界を幾何学的な制約として学習し、生成時の内部表現を検査する。スパースオートエンコーダ(SAE)による特徴抽出も活用し、カテゴリごとに必要な制約を絞り込むことで、従来必要だった網羅的なパラメータ探索の削減を図っている。
特許番号は第7909349号で、発明の名称は「学習モデル用ガードレール実装方法、学習モデル用プログラムおよび人工知能システム」。発明者は上原史皓氏、今井冴生氏で、特許権者はKonoe Intelligenceとなっている。
同社は今後、機械論的解釈可能性を活用したAI内部検証技術の研究開発を進め、本特許技術を含むガードレール基盤の社会実装を推進する。政府機関や企業との連携を通じ、日本発のAI安全性評価技術の構築を目指す。
引用元記事:https://prtimes.jp/main/html/rd/p/000000019.000160129.html



