FlashLabsは2026年8月31日、OrcaRouter上でZ.aiのオープンウェイトLLM「GLM-5.3」をApple Silicon向けに最適化したMLX量子化版「GLM-5.3-MLX」をHugging Faceで公開しました。GLM-5.3は総パラメータ約743B(MoEでアクティブ40B)、コンテキスト長は100万トークンで、FP8時点のモデルサイズ約1.51TBを2-bitで約322GBまで小型化したとしています。
量子化は、キャリブレーション用データ不要の混合精度量子化「OrcaSAQ」で実施し、2-bit/3-bit/4-bit/6-bitの4バリアントを提供します(8-bit版はなし)。開発元検証では2-bit版でも精度維持が約80.2%とされ、6-bit版はFP8比のコサイン類似度が0.9997以上です。
背景には、ローカル実行がデータを外部送信せず低レイテンシーである一方、最先端のオープンウェイトモデルは数百GB規模のメモリを要し、一般的な開発機で動かしにくい課題があります。今回の公開により、512GBメモリ搭載Mac(M3 Ultra)で2-bit〜4-bitのローカル実行が可能になる目安を示しました。
今後は量子化技術の研究開発とモデルカタログ拡充を継続し、ローカル実行が難しい場合はOrcaRouterのAPI経由でフル精度利用も可能だとしています。
【関連リンク】
公式HP:https://www.orcarouter.ai/ja
公式HP:https://www.flashlabs.ai
公式HP:https://www.continuum01.ai
RSS URL:https://www.flashintel.ai
AI生成記事のため誤りを含む場合があります
PRTIMES
PRTIMES
OrcaRouter、1.5TB超の大規模LLM「GLM-5.3」を1台のMacで実行できる「GLM-5.3-MLX」を公開






