适合 Agent 任务的大模型对比总表-AIGC大模型社区-AI工具清单-四海清单

适合 Agent 任务的大模型对比总表

Agent大模型对比表(国内/国外|API/本地部署度)

说明:

  1. 推理速度​:本地为 ​RTX4090 + Q4\_K\_M量化(tokens/s)​;API为云端常规吞吐(tokens/s);受上下文长度、KV缓存、推理引擎影响会浮动
  2. 训练数据量​:公开披露数值;未公开标注「未披露」
  3. Agent评估重点:工具调用稳定性、任务分解、JSON结构化输出、多轮纠错、长记忆
  4. 可用方式:✅支持;❌不支持

🇨🇳 国内开源模型

模型名称 可用方式
API / 本地部署
训练数据量 推理速度
(本地RTX4090 Q4_K_M)
上下文窗口 多模态 Agent核心能力 优点 短板 推荐场景
Qwen2.5 / Qwen3(含Qwen-VL) ✅ API
✅ 本地
约3.6T tokens 7B:90110 tok/s14B:5065 tok/s 128K~1M 文本+图像 工具调用稳定,JSON规范,中文Agent强,多模态工具调用成熟 生态完善,Apache2.0商用友好,Ollama/vLLM/SGLang全适配 超长复杂链式任务弱于闭源旗舰 通用Agent、RAG智能体、图文多模态Agent、内网私有化
DeepSeek-V3 ✅ API
✅ 本地
14.8T tokens 6.7B:95~115 tok/s 128K~1M 文本 推理强,代码Agent顶尖,链式思考优秀 MIT协议,代码/数学Agent性价比极高 原生图像理解弱,超长多轮工具状态易漂移 代码Agent、数据分析Agent、数学推理智能体
GLM-4 / GLM-4-V ✅ API
✅ 本地
约2T tokens 9B:70~85 tok/s 128K~200K 文本+图像 长文本记忆优秀,RAG+Agent友好,结构化输出稳定 智谱原生优化工具调用,企业场景成熟 大参数量本地显存开销偏高 企业文档RAG Agent、长文档处理智能体
MiniCPM-o 4.5B ✅ API
✅ 本地
约1.2T tokens 4.5B:120~150 tok/s 32K 文本+图像+音频 轻量全模态Agent,音图文一体,小显存可跑 4.5B轻量化,RTX4070可本地跑实时语音Agent 复杂长链路规划能力有限 端侧Agent、实时语音多模态助手、边缘设备智能体
Kimi K2.6 ✅ API
✅ 本地
未披露 量化后20~35 tok/s(大参数量) 256K 文本+图像 百万级长上下文Agent,长文档自动规划,多轮工具迭代强 超长文档处理能力强,代码Agent强 本地部署硬件门槛极高,量化后Agent能力衰减明显 长文档研究Agent、大型代码工程Agent
MiniMax M3 ✅ API
✅ 本地
未披露 量化后15~30 tok/s 1M 文本+图像+视频 多模态Agent,网页浏览类Agent评测表现优秀 原生支持视频理解,适合自主搜索研究 权重体积大,普通消费卡推理卡顿 多模态研究Agent、视频理解Agent

🌍 国外模型

模型名称 可用方式
API / 本地部署
训练数据量 推理速度
(本地RTX4090 Q4_K_M)
上下文窗口 多模态 Agent核心能力 优点 短板 推荐场景
Llama3.1 / Llama4 ✅ API
✅ 本地
约15T tokens 8B:85~100 tok/s 128K 文本+图像 工具调用生态最完善,LangGraph/LlamaIndex原生适配Agent 社区案例极多,开源Agent工程首选 中文理解弱于国内模型;许可证商用有约束 通用本地Agent、多智能体协同、海外业务自动化
Mistral Large3 / Pixtral ✅ API
✅ 本地
约8T tokens 7B:100120 tok/s12B:6075 tok/s 128K 文本+图像 推理速度快,工具调用简洁稳定,JSON干净 Apache2.0无版权顾虑,轻量高吞吐 超长多步骤任务容易丢失状态 高并发轻量Agent、实时工具调用服务
Phi-4(微软) ✅ API
✅ 本地
0.4T高质量合成数据 14B:45~60 tok/s 128K 文本+图像 小参数量强推理,工具调用精准,结构化输出好 14B体积显存友好,适合嵌入式Agent 复杂多轮规划上限不高 轻量本地Agent、嵌入式工具助手
GPT‑4o ✅ API
❌ 无本地权重
约10T tokens 云端API:60~90 tok/s 128K 文本+图像+音频 Agent综合天花板,多模态+工具调用、自主纠错、复杂任务规划极强 工具调用鲁棒性最强,多模态Agent基准 不可本地部署,成本高,国内访问受限 复杂研究Agent、GUI/浏览器高级自动化Agent
Claude 3.7 Sonnet ✅ API
❌ 无本地权重
未披露 云端API:40~70 tok/s 200K~2M 文本+图像 超长上下文Agent标杆,百万token长任务记忆稳定,多轮工具迭代稳定 长文档链式Agent、多步骤规划能力强 无本地权重;国内访问受限 长文档深度研究Agent、法律/研发多步骤智能体
Gemini 2.5 Pro ✅ API
❌ 无本地权重
未披露 云端API:50~80 tok/s 1M 文本+图像+视频 原生Agent沙盒,自带代码执行、网页浏览能力 多媒体Agent能力强,原生多模态融合 工具调用偶发幻觉,中文能力一般 多媒体研究Agent、代码沙盒智能体

📌 选型决策要点

1)优先API调用(不本地部署,追求最强Agent能力)

国内API首选:​Qwen3、DeepSeek-V3、GLM-4​,国内网络稳定,OpenAI兼容工具调用格式 海外API首选:​GPT‑4o、Claude3.7 Sonnet​,复杂长链路Agent综合能力最强

2)优先本地部署(数据不出内网,私有化Agent)

  • 通用文本Agent:Qwen2.5 7B/14B、DeepSeek-V3 6.7B、Llama3.1 8B、Mistral7B
  • 本地多模态Agent:Qwen2.5-VL、MiniCPM-o、Pixtral
  • 轻量化小显存本地Agent:MiniCPM-o 4.5B、Phi-4

3)Agent模型选型一句话总结

  • 中文内网私有化Agent:​Qwen系列​(综合平衡)
  • 本地代码/数据分析Agent:DeepSeek-V3
  • 长文档RAG+Agent:GLM4 / Kimi K2.6
  • 海外生态本地Agent:Llama3.1
  • 最高复杂度多模态、多步骤研究Agent:GPT4o / Claude Sonnet(仅API)

4)新增维度快速解读

  • 训练数据量​:并非越大越好;DeepSeek/Phi使用高质量过滤/合成数据,小数据也能获得优秀推理与Agent能力;数据质量 > 单纯总量
  • 本地推理速度​:7B及以下模型在RTX4090上可达到90+ tok/s,交互流畅;14B一般50左右;30B+大参数量本地速度明显下降,适合后台批处理,不适合实时Agent交互

🧰 Agent配套开源框架(可对接上面所有模型,本地/API均可)

  • LangGraph:多轮状态Agent,支持工具调用循环
  • LlamaIndex:RAG+Agent一体化
  • OpenClaw:本地LLM驱动GUI/浏览器Agent
  • SGLang:高性能推理,原生支持工具调用、多模态
  • vLLM:高吞吐推理服务,私有化Agent后端

 

请登录后发表评论

    没有回复内容