模型矩阵 | Model Matrix
校验日期: 2026-07-31 本页是全库唯一的模型型号来源。 其余章节正文只写“能力档位“,具体型号一律回链到这里。
本节的工具价格核验日期: 2026-08。SaaS 定价变动频繁,下单前请到各家官网复核。
为什么正文不写具体型号
这个知识库里的方法论半衰期以年计,模型型号的半衰期以月计。举两个就发生在本页校验当周的例子:OpenAI 在 2026-07-30 把 Luna 档降价 80%、Terra 档降价 20%;Google 在 2026-07-21 一次放出三个新 Flash 型号。任何把型号写死在正文里的写法,都会在下一个季度变成错误信息。
所以本库的约定是:
- 正文写“用前沿推理档模型做竞品差评聚类“,不写“用某某型号做竞品差评聚类“
- 型号、价格、上下文长度这些易腐事实,只存在于本页,并且带校验日期
- 换代时只改这一个文件,中英日三语各一处,不必翻 60 多章
唯一的例外是 AI 技术演进。那一章讲的是历史,里面的 GPT-3、Claude 2 这些型号是叙事对象本身,不该被替换。
四个能力档位
档位定义是稳定的,可以直接拿去做技术选型,不随厂商发版变化。
| 档位 | 什么时候用它 | 电商场景里的典型任务 | 相对成本 |
|---|---|---|---|
| T1 前沿档 | 结果错了代价很大,或任务需要多步推理 | 合规风险研判、专利规避分析、年度选品战略、复杂归因建模 | 基准 ×10 |
| T2 主力档 | 日常批量作业的默认选择 | Listing 批量生成、广告文案、评论聚类、客服草稿 | 基准 ×3 |
| T3 高速档 | 任务简单但量极大,延迟敏感 | 评论情感打标、类目归类、字段抽取、翻译初稿 | 基准 ×1 |
| T4 本地档 | 数据不能出境,或长期高频调用要压成本 | 含客户信息的订单数据处理、内部知识库问答、离线批处理 | 电费 + 一次性硬件 |
选型的经验法则:先用 T1 把流程跑通并产出一批“标准答案“,再用 T2/T3 跑量,拿标准答案做验收。绝大多数电商任务最终稳定在 T2。直接从 T3 开始调 Prompt 是常见的时间浪费——你会分不清是 Prompt 写得差还是模型不够用。
各档位当前型号
以下型号与价格截至 2026-07-31。价格为 API 每百万 token 的(输入/输出),仅用于横向比较量级,实际以官方页面为准。
闭源 API
| 厂商 | T1 前沿档 | T2 主力档 | T3 高速档 |
|---|---|---|---|
| Anthropic | Claude Opus 5claude-opus-5 · $5/$25 · 1M 上下文 | Claude Sonnet 5claude-sonnet-5 · $2/$10(2026-08-31 前的上市价,之后 $3/$15) | Claude Haiku 4.5claude-haiku-4-5 |
| OpenAI | GPT-5.6 Solgpt-5.6-sol(别名 gpt-5.6)· $5/$30 | GPT-5.6 Terragpt-5.6-terra · $2.50/$15 | GPT-5.6 Lunagpt-5.6-luna |
| Gemini 3.1 Pro(Preview) Gemini 2.5 Pro(Stable) | Gemini 3.6 Flash (官方定位的 workhorse) | Gemini 3.5 Flash-Lite |
几点值得注意:
- GPT-5.6 三档共享约 105 万 token 上下文、12.8 万 token 最大输出,知识截止 2026-02-16。跨境场景里“把整个类目的竞品 Listing 一次性喂进去“已经不再需要分片。
- OpenAI 在 2026-07-30 下调了 Luna(−80%)和 Terra(−20%)的价格。如果你的成本模型是几个月前建的,值得重算一遍。
- Google 的版本号不按档位对齐——Flash 档已经到 3.6,Pro 档的 3.1 还挂着 Preview,3.5 Pro 尚在合作伙伴测试。选 Google 时要按“档位“而不是“版本号大小“来挑。
- ChatGPT 网页/App 端的型号名与 API 不是一回事(App 端当前是 GPT-5.3 Instant 默认、GPT-5.4 Thinking/Pro、GPT-5.5、GPT-5.6 并存)。给团队写 SOP 时注意区分,运营同学用的是 App 端。
T4 本地档(开放权重)
| 模型 | 规模 | 适合什么 | 许可 |
|---|---|---|---|
| Qwen3 | 8B / 14B(普通显卡)· 30B-A3B MoE(约 24GB 显存) | 中文电商场景的默认首选,多语言强 | Apache 2.0 |
| Qwen3-235B-A22B | 235B MoE | 当前开放权重里综合基准最强 | Apache 2.0 |
| Qwen3-Coder-480B | 480B MoE | 写数据管道/自动化脚本(SWE-bench Verified 69.6%) | Apache 2.0 |
| Gemma 3 27B | 27B | 单张大显存卡即可跑,通用任务稳 | Gemma 许可 |
| DeepSeek R1 | — | 需要推理链的任务(MATH-500 97.3%) | MIT |
跑法:装 Ollama 或 LM Studio,ollama run qwen3:8b 直接拉量化 GGUF 并暴露一个 OpenAI 兼容的本地接口——意味着上面所有用 OpenAI SDK 写的示例代码,改一个 base_url 就能指向本地。高并发生产环境用 vLLM,纯 CPU/边缘设备用 llama.cpp。显存不够就降量化位数(Q4 及以下),代价是质量下降。
详细部署步骤见 B5 本地模型部署。
视频生成
| 模型 | 强在哪 | 电商用途 |
|---|---|---|
| Veo 3.1(Google Flow) | 电影感 + 原生音频生成 | 需要成片质感、带声音的广告片 |
| Runway Gen-4.5 | 剪辑控制强,团队协作友好 | 需要精细创意控制的交付物 |
| Kling 3 | 运动真实感最好 | 产品动态展示 |
| Seedance 2 | 图生视频 + 长镜头规划 | 广告、品牌场景、分镜驱动的制作 |
电商场景最重要的一条经验:产品本身永远用图生视频(从真实产品照出发),不要用文生视频。文生视频会重新“想象“你的产品,细节、比例、logo 都会变,拿去做广告素材是合规风险。
OpenAI 的 Sora 2 已不在推荐之列——消费端于 2026-04 结束,API 定于 2026-09-24 停用。如果你的流程里还依赖它,需要迁移。
图像生成
| 模型 | 强在哪 | 电商用途 |
|---|---|---|
| Nano Banana Pro(Google) | photorealism + 图上文字 + 多语言 | 产品图、带文案的营销图、多市场本地化素材 |
| FLUX.2 Pro | 照片级产品图,API 走量 | 高频出图的自动化 Pipeline |
| GPT Image 2 | 复杂指令遵循最好 | 一次描述清楚多个约束的场景图 |
| Midjourney V8.1 | 审美上限最高 | 品牌调性图、Lifestyle 场景 |
| Ideogram 4 | 排版与文字 | 需要精确文字的 Banner |
| Recraft V4.1 | 设计系统/矢量 | 图标、品牌视觉规范 |
“最好的图像模型“已经不存在单一答案。实践中的组合是:走量用 FLUX.2 Pro 或 Nano Banana Pro 接 API,需要审美把关的主图用 Midjourney 人工筛,需要精确文字的用 Ideogram。详见 A7 视觉内容 和 B9 AI 图片 Pipeline。
怎么自己复核这张表
这张表会过期,下面是自查步骤(建议每季度做一次,10 分钟):
- 官方定价页(唯一可信来源,第三方对比站普遍滞后)
- Anthropic: https://www.anthropic.com/pricing
- OpenAI: https://openai.com/api/pricing/
- Google: https://ai.google.dev/gemini-api/docs/pricing
- 官方模型列表页看有没有新档位、老型号有没有标 deprecated
- 开放权重榜单看 T4 档换代:Hugging Face 的开源榜、LMArena
- 改完把本页顶部的校验日期一并更新,并在下方变更记录里加一行
判断“要不要动正文“的标准很简单:只要档位划分没变,正文一个字都不用改。 只有当出现了一个现有四档装不下的新形态(比如某个厂商推出专门的电商垂直模型),才需要回头调整正文表述。
变更记录
| 日期 | 变更 |
|---|---|
| 2026-07-31 | 建立本页。全库正文改为能力档位表述,型号引用统一回链此处 |
| 2026-07-31 | 补入视频生成档;标注 Sora 2 已弃用(消费端 2026-04 结束,API 2026-09-24 停用) |