7 min read

Qwen 3.5 Small — Alibaba の 9B モデルが 120B を超えた、オンデバイス AI 元年

alibabaqwenopen-sourceon-device-aillmedge-ai

概要

2026年3月2日、Alibaba の Qwen チームが Qwen 3.5 Small シリーズを公開した。0.8B・2B・4B・9B の 4 モデルをすべて Apache 2.0 ライセンスで提供する。

最大の話題は 9B モデルの benchmark 性能。OpenAI の GPT-OSS-120B(13 倍のパラメータ数)を MMLU-Pro、GPQA Diamond、IFEval、LongBench v2 で上回った。「大きいモデルが強い」という常識を崩す数字だ。

3月9日には edge device 向けの追加機能強化版が続いており、Alibaba は 16 日間で Small シリーズの全 9 モデルをロールアウトした。

モデルラインナップと動作環境

モデル仕様

モデルVRAM(BF16)VRAM(4bit 量子化)主な用途
Qwen3.5-0.8B~1.6 GB~0.5 GBIoT・組み込み・オフライン chatbot
Qwen3.5-2B~4 GB~1.2 GBスマートフォン・ラップトップ
Qwen3.5-4B~8 GB~2.5 GBコーディング・マルチモーダル推論
Qwen3.5-9B~18 GB~5.5 GB複雑な推論・エージェント

2B はスマートフォンで動作可能。9B でも 4bit 量子化(Q4_K_M フォーマット)を使えば 8GB GPU で動く。

コンテキストウィンドウ

全モデル 262K トークン をネイティブサポート。YaRN 圧縮を使えば 1M トークン超まで拡張できる。

対応フレームワーク

llama.cpp、Ollama、MLX(Apple Silicon)、vLLM に対応しており、既存のローカル LLM 環境にそのまま組み込める。

Benchmark — 9B が 13 倍のモデルを超えた

主要 benchmark 比較

BenchmarkQwen3.5-9BGPT-OSS-120BQwen3.5-4BGPT-5-Nano
MMMU-Pro(視覚推論)70.157.2
MathVision(数学 × 視覚)78.962.2
GPQA Diamond(理科推論)81.777.2
IFEval(指示遵守)91.588.9
LongBench v2(長文)55.248.0

9B の MMMU-Pro スコアは GPT-5-Nano を 12.9 ポイント上回る。MathVision の差は 16.7 ポイント。4B ですら GPT-5-Nano と Gemini 2.5 Flash を複数 benchmark で超えた。

0.8B の実用性

最小モデルの 0.8B でも MathVista 62.2、OCRBench 74.5 を記録しており、IoT デバイスや組み込み環境で実際に使えるレベルに達している。

アーキテクチャ — Gated DeltaNet の仕組み

Qwen 3.5 Small は Gated DeltaNet と呼ぶハイブリッドアテンション機構を採用している。

線形アテンション層と従来の softmax アテンション層を 3:1 の比率で混在させる設計だ。線形アテンションはメモリ複雑度を定数に保ち、softmax アテンションが推論の精度を補完する。長い context を扱いながら消費メモリを抑える構造的な工夫がこの benchmark 性能を支えている。

Vision encoder には Conv3d patch embeddings を使用しており、静止画だけでなく動画のフレーム間の時間的ダイナミクスも理解できる。テキスト・画像・動画を 1 つのモデルで同時に処理するネイティブマルチモーダルはシリーズ全モデルに共通している。

オープンソース × Apache 2.0 の意味

Qwen 3.5 Small は全モデルが Apache 2.0 ライセンスで公開されている。商用利用・改変・再配布が自由だ。

ライセンス商用利用改変再配布代表モデル
Apache 2.0Qwen 3.5 Small、Llama 3.x
MITPhi-3-mini
Meta Custom制限あり制限あり制限あり旧 Llama 2
独自(非公開)GPT-4o、Claude

「使えるが中身は見えない」クラウド API との最大の差異は、重みを手元に置いて改変できる点だ。ファインチューニングして自社特化モデルを作り、そのまま商品化できる。

日本への示唆

プライバシー規制とオンデバイス AI の相性

日本では個人情報保護法の改正(2022年)以降、個人データを第三者サーバーに送信する際の規制が厳格化している。医療・金融・行政の現場では「データを外に出せない」制約が依然として多い。

Qwen 3.5 のようなオンデバイス・オンプレミスで動く高性能モデルは、この制約と整合する。

業界クラウド AI の制約オンデバイス AI でできること
医療電子カルテの外部送信は要同意院内 GPU で推論、データは院外に出ない
金融顧客情報の第三者提供は制限ありオンプレサーバーで契約書・稟議を AI 処理
製造設計図・製造レシピは門外不出工場内エッジデバイスで品質判定
行政機密文書はクラウド利用禁止ローカル LLM でドキュメント要約・分類

SI 企業・ベンダーのビジネスチャンス

Apache 2.0 ライセンスは「改変して製品として売れる」ことを意味する。日本の SI 企業が Qwen 3.5 をベースに業界特化ファインチューニングを施し、オンプレパッケージとして販売するビジネスが成立する。

「API を売る」だけでなく「ファインチューニング済みモデル + 運用保守」という形で差別化できる。GPT-4o や Claude の API 再販と違い、参入障壁を自社で構築しやすい。

エンジニアのローカル開発環境が変わる

4B モデルが 8GB RAM で動くということは、M3 MacBook Air(16GB 統合メモリ)で 9B を快適に走らせられる。

# Ollama でのインストールと実行
ollama pull qwen3.5:9b
ollama run qwen3.5:9b "このコードをレビューして"

# vLLM での API サーバー起動
python -m vllm.entrypoints.openai.api_server \
  --model Qwen/Qwen3.5-9B-Instruct \
  --dtype bfloat16 \
  --max-model-len 32768

Claude Code や Cursor の backend を Qwen 3.5 に差し替えて、ネット接続なしで AI コーディング補助を使う、という構成が現実的になった。

中国 AI の競争力という文脈

DeepSeek R1(2025年1月)が「中国のオープンソース AI が西側 frontier モデルに迫る」という衝撃を与えた。Qwen 3.5 Small はその延長線上にある。

中国オープンソース AI の主要リリース時期ハイライト
DeepSeek-V22024年5月MoE で低コスト高性能
Qwen 2.52024年9月72B が GPT-4o に迫る
DeepSeek R12025年1月推論特化でo1 相当
Qwen 3(旗艦)2025年Q3235B MoE モデル
Qwen 3.5 Small2026年3月9B で 120B 超え

中国発の研究が「効率性」の競争軸で先行している。「大きいモデルを作れば勝てる」時代から「小さくて速いモデルが現場を制する」時代へのシフトを Alibaba が象徴する。

まとめ

ポイント内容
9B で 120B 超えGPT-OSS-120B を複数 benchmark で上回る capability density
Apache 2.0改変・商用利用・再配布が自由。SI 製品化の素材になる
オンデバイス動作2B はスマートフォン、9B は 8GB GPU。クラウド不要
262K context長文書類・大規模コードベースをそのまま処理
日本のプライバシー制約と相性抜群データを外に出さない AI 処理が規制環境に整合

「高性能 AI = クラウド API」という前提が崩れ始めた。Qwen 3.5 Small はその加速装置だ。日本の医療・金融・製造という規制の厚い産業で、オンプレ AI 導入の選択肢が現実的な重みを持ち始める。

参考リンク