FlashLabs、セキュリティ研究向け「GLM-5.3-Flash-Uncensored」のウェイトをOrcaRouterで提供

FlashLabsは、米国のAI研究機関Continuum AIが開発したAI推論ゲートウェイ「OrcaRouter」において、セキュリティ研究者やレッドチーム・ブルーチーム向けのオープンウェイトモデル「GLM-5.3-Flash-Uncensored」のウェイトが公開されたと発表した。FlashLabsは同モデルを日本市場向けに独占提供する。
同モデルは、Z.aiが公開したオープンウェイトLLM「GLM-5.3-Flash」をベースに、コンテンツフィルタリングを緩和した研究用途向けモデル。総パラメータ320B、アクティブパラメータ18BのMoE(Mixture of Experts)構成を採用するベースモデルに対し、LoRAや脱獄プロンプトを利用せず、拒否応答の除去をモデルのウェイトへ直接適用している。オリジナルと同じブロックFP8精度で提供する。
開発元による評価では、各種ベンチマークにおける拒否率が大幅に低下した。MaliciousInstructでは96%から11%、JailbreakBenchでは93%から12%、AdvBenchでは97%から15%、HarmBenchでは93%から18%となった。また、良性のクエリまで過剰に拒否する割合を測るXSTestでは、2.4%から0.4%に低減した。
同モデルは、AIシステムのセキュリティ検証を目的とした研究での利用を想定する。攻撃者の視点から脆弱性を検証するレッドチームや、防御側からセキュリティ対策を検証するブルーチームでは、実環境に近いモデルの挙動を確認することが重要となる。一方、通常の安全フィルタリングを施したモデルでは再現が難しい検証ケースもあることから、研究用途に限定してフィルタリングを緩和したモデルを提供する。
Continuum AIでは、悪用リスクに配慮し、Hugging Face上で利用申請制とライセンス条項を組み合わせた形で公開。AI安全性や解釈可能性の研究、レッドチーム・ブルーチームによるセキュリティ検証、AIモデルの拒否メカニズムに関する研究などを主な用途としている。
また、GLM-5.3-Flashのアラインメントについて、単一の線形な「拒否方向」だけでは説明できない可能性も示されており、最先端AIモデルの内部構造や安全性調整の仕組みを研究する上でも分析対象になるとしている。
一方、OrcaRouterでは、本番環境でAIを利用する企業向けにガードレール機能を標準で提供。PIIシールドやコンテンツポリシー、エージェントファイアウォールなどを備え、研究用途と本番利用を分けた運用を可能にする。
「GLM-5.3-Flash-Uncensored」はHugging Faceで公開されており、利用には申請とライセンス条項への同意が必要。今後はGGUFやMLXなどの量子化形式も展開する予定だ。FlashLabsは、OrcaRouterを通じてセキュリティ研究コミュニティへの貢献と、企業におけるAIの安全な利用環境の整備を進める。
引用元記事:https://prtimes.jp/main/html/rd/p/000000072.000138449.html



