Agent大模型对比表(国内/国外|API/本地部署度)
说明:
- 推理速度:本地为 RTX4090 + Q4\_K\_M量化(tokens/s);API为云端常规吞吐(tokens/s);受上下文长度、KV缓存、推理引擎影响会浮动
- 训练数据量:公开披露数值;未公开标注「未披露」
- Agent评估重点:工具调用稳定性、任务分解、JSON结构化输出、多轮纠错、长记忆
- 可用方式:✅支持;❌不支持
🇨🇳 国内开源模型
| 模型名称 | 可用方式 API / 本地部署 |
训练数据量 | 推理速度 (本地RTX4090 Q4_K_M) |
上下文窗口 | 多模态 | Agent核心能力 | 优点 | 短板 | 推荐场景 |
|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5 / Qwen3(含Qwen-VL) | ✅ API ✅ 本地 |
约3.6T tokens | 7B:90 |
128K~1M | 文本+图像 | 工具调用稳定,JSON规范,中文Agent强,多模态工具调用成熟 | 生态完善,Apache2.0商用友好,Ollama/vLLM/SGLang全适配 | 超长复杂链式任务弱于闭源旗舰 | 通用Agent、RAG智能体、图文多模态Agent、内网私有化 |
| DeepSeek-V3 | ✅ API ✅ 本地 |
14.8T tokens | 6.7B:95~115 tok/s | 128K~1M | 文本 | 推理强,代码Agent顶尖,链式思考优秀 | MIT协议,代码/数学Agent性价比极高 | 原生图像理解弱,超长多轮工具状态易漂移 | 代码Agent、数据分析Agent、数学推理智能体 |
| GLM-4 / GLM-4-V | ✅ API ✅ 本地 |
约2T tokens | 9B:70~85 tok/s | 128K~200K | 文本+图像 | 长文本记忆优秀,RAG+Agent友好,结构化输出稳定 | 智谱原生优化工具调用,企业场景成熟 | 大参数量本地显存开销偏高 | 企业文档RAG Agent、长文档处理智能体 |
| MiniCPM-o 4.5B | ✅ API ✅ 本地 |
约1.2T tokens | 4.5B:120~150 tok/s | 32K | 文本+图像+音频 | 轻量全模态Agent,音图文一体,小显存可跑 | 4.5B轻量化,RTX4070可本地跑实时语音Agent | 复杂长链路规划能力有限 | 端侧Agent、实时语音多模态助手、边缘设备智能体 |
| Kimi K2.6 | ✅ API ✅ 本地 |
未披露 | 量化后20~35 tok/s(大参数量) | 256K | 文本+图像 | 百万级长上下文Agent,长文档自动规划,多轮工具迭代强 | 超长文档处理能力强,代码Agent强 | 本地部署硬件门槛极高,量化后Agent能力衰减明显 | 长文档研究Agent、大型代码工程Agent |
| MiniMax M3 | ✅ API ✅ 本地 |
未披露 | 量化后15~30 tok/s | 1M | 文本+图像+视频 | 多模态Agent,网页浏览类Agent评测表现优秀 | 原生支持视频理解,适合自主搜索研究 | 权重体积大,普通消费卡推理卡顿 | 多模态研究Agent、视频理解Agent |
🌍 国外模型
| 模型名称 | 可用方式 API / 本地部署 |
训练数据量 | 推理速度 (本地RTX4090 Q4_K_M) |
上下文窗口 | 多模态 | Agent核心能力 | 优点 | 短板 | 推荐场景 |
|---|---|---|---|---|---|---|---|---|---|
| Llama3.1 / Llama4 | ✅ API ✅ 本地 |
约15T tokens | 8B:85~100 tok/s | 128K | 文本+图像 | 工具调用生态最完善,LangGraph/LlamaIndex原生适配Agent | 社区案例极多,开源Agent工程首选 | 中文理解弱于国内模型;许可证商用有约束 | 通用本地Agent、多智能体协同、海外业务自动化 |
| Mistral Large3 / Pixtral | ✅ API ✅ 本地 |
约8T tokens | 7B:100 |
128K | 文本+图像 | 推理速度快,工具调用简洁稳定,JSON干净 | Apache2.0无版权顾虑,轻量高吞吐 | 超长多步骤任务容易丢失状态 | 高并发轻量Agent、实时工具调用服务 |
| Phi-4(微软) | ✅ API ✅ 本地 |
0.4T高质量合成数据 | 14B:45~60 tok/s | 128K | 文本+图像 | 小参数量强推理,工具调用精准,结构化输出好 | 14B体积显存友好,适合嵌入式Agent | 复杂多轮规划上限不高 | 轻量本地Agent、嵌入式工具助手 |
| GPT‑4o | ✅ API ❌ 无本地权重 |
约10T tokens | 云端API:60~90 tok/s | 128K | 文本+图像+音频 | Agent综合天花板,多模态+工具调用、自主纠错、复杂任务规划极强 | 工具调用鲁棒性最强,多模态Agent基准 | 不可本地部署,成本高,国内访问受限 | 复杂研究Agent、GUI/浏览器高级自动化Agent |
| Claude 3.7 Sonnet | ✅ API ❌ 无本地权重 |
未披露 | 云端API:40~70 tok/s | 200K~2M | 文本+图像 | 超长上下文Agent标杆,百万token长任务记忆稳定,多轮工具迭代稳定 | 长文档链式Agent、多步骤规划能力强 | 无本地权重;国内访问受限 | 长文档深度研究Agent、法律/研发多步骤智能体 |
| Gemini 2.5 Pro | ✅ API ❌ 无本地权重 |
未披露 | 云端API:50~80 tok/s | 1M | 文本+图像+视频 | 原生Agent沙盒,自带代码执行、网页浏览能力 | 多媒体Agent能力强,原生多模态融合 | 工具调用偶发幻觉,中文能力一般 | 多媒体研究Agent、代码沙盒智能体 |
📌 选型决策要点
1)优先API调用(不本地部署,追求最强Agent能力)
国内API首选:Qwen3、DeepSeek-V3、GLM-4,国内网络稳定,OpenAI兼容工具调用格式 海外API首选:GPT‑4o、Claude3.7 Sonnet,复杂长链路Agent综合能力最强
2)优先本地部署(数据不出内网,私有化Agent)
- 通用文本Agent:Qwen2.5 7B/14B、DeepSeek-V3 6.7B、Llama3.1 8B、Mistral7B
- 本地多模态Agent:Qwen2.5-VL、MiniCPM-o、Pixtral
- 轻量化小显存本地Agent:MiniCPM-o 4.5B、Phi-4
3)Agent模型选型一句话总结
- 中文内网私有化Agent:Qwen系列(综合平衡)
- 本地代码/数据分析Agent:DeepSeek-V3
- 长文档RAG+Agent:GLM4 / Kimi K2.6
- 海外生态本地Agent:Llama3.1
- 最高复杂度多模态、多步骤研究Agent:GPT4o / Claude Sonnet(仅API)
4)新增维度快速解读
- 训练数据量:并非越大越好;DeepSeek/Phi使用高质量过滤/合成数据,小数据也能获得优秀推理与Agent能力;数据质量 > 单纯总量
- 本地推理速度:7B及以下模型在RTX4090上可达到90+ tok/s,交互流畅;14B一般50左右;30B+大参数量本地速度明显下降,适合后台批处理,不适合实时Agent交互
🧰 Agent配套开源框架(可对接上面所有模型,本地/API均可)
- LangGraph:多轮状态Agent,支持工具调用循环
- LlamaIndex:RAG+Agent一体化
- OpenClaw:本地LLM驱动GUI/浏览器Agent
- SGLang:高性能推理,原生支持工具调用、多模态
- vLLM:高吞吐推理服务,私有化Agent后端
@1x.png)




没有回复内容