Keyboard shortcuts

Press or to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

模型矩阵 | Model Matrix

校验日期: 2026-07-31 本页是全库唯一的模型型号来源。 其余章节正文只写“能力档位“,具体型号一律回链到这里。


本节的工具价格核验日期: 2026-08。SaaS 定价变动频繁,下单前请到各家官网复核。

为什么正文不写具体型号

这个知识库里的方法论半衰期以年计,模型型号的半衰期以月计。举两个就发生在本页校验当周的例子:OpenAI 在 2026-07-30 把 Luna 档降价 80%、Terra 档降价 20%;Google 在 2026-07-21 一次放出三个新 Flash 型号。任何把型号写死在正文里的写法,都会在下一个季度变成错误信息。

所以本库的约定是:

  • 正文写“用前沿推理档模型做竞品差评聚类“,不写“用某某型号做竞品差评聚类“
  • 型号、价格、上下文长度这些易腐事实,只存在于本页,并且带校验日期
  • 换代时只改这一个文件,中英日三语各一处,不必翻 60 多章

唯一的例外是 AI 技术演进。那一章讲的是历史,里面的 GPT-3、Claude 2 这些型号是叙事对象本身,不该被替换。


四个能力档位

档位定义是稳定的,可以直接拿去做技术选型,不随厂商发版变化。

档位什么时候用它电商场景里的典型任务相对成本
T1 前沿档结果错了代价很大,或任务需要多步推理合规风险研判、专利规避分析、年度选品战略、复杂归因建模基准 ×10
T2 主力档日常批量作业的默认选择Listing 批量生成、广告文案、评论聚类、客服草稿基准 ×3
T3 高速档任务简单但量极大,延迟敏感评论情感打标、类目归类、字段抽取、翻译初稿基准 ×1
T4 本地档数据不能出境,或长期高频调用要压成本含客户信息的订单数据处理、内部知识库问答、离线批处理电费 + 一次性硬件

选型的经验法则:先用 T1 把流程跑通并产出一批“标准答案“,再用 T2/T3 跑量,拿标准答案做验收。绝大多数电商任务最终稳定在 T2。直接从 T3 开始调 Prompt 是常见的时间浪费——你会分不清是 Prompt 写得差还是模型不够用。


各档位当前型号

以下型号与价格截至 2026-07-31。价格为 API 每百万 token 的(输入/输出),仅用于横向比较量级,实际以官方页面为准。

闭源 API

厂商T1 前沿档T2 主力档T3 高速档
AnthropicClaude Opus 5
claude-opus-5 · $5/$25 · 1M 上下文
Claude Sonnet 5
claude-sonnet-5 · $2/$10(2026-08-31 前的上市价,之后 $3/$15)
Claude Haiku 4.5
claude-haiku-4-5
OpenAIGPT-5.6 Sol
gpt-5.6-sol(别名 gpt-5.6)· $5/$30
GPT-5.6 Terra
gpt-5.6-terra · $2.50/$15
GPT-5.6 Luna
gpt-5.6-luna
GoogleGemini 3.1 Pro(Preview)
Gemini 2.5 Pro(Stable)
Gemini 3.6 Flash
(官方定位的 workhorse)
Gemini 3.5 Flash-Lite

几点值得注意:

  • GPT-5.6 三档共享约 105 万 token 上下文、12.8 万 token 最大输出,知识截止 2026-02-16。跨境场景里“把整个类目的竞品 Listing 一次性喂进去“已经不再需要分片。
  • OpenAI 在 2026-07-30 下调了 Luna(−80%)和 Terra(−20%)的价格。如果你的成本模型是几个月前建的,值得重算一遍。
  • Google 的版本号不按档位对齐——Flash 档已经到 3.6,Pro 档的 3.1 还挂着 Preview,3.5 Pro 尚在合作伙伴测试。选 Google 时要按“档位“而不是“版本号大小“来挑。
  • ChatGPT 网页/App 端的型号名与 API 不是一回事(App 端当前是 GPT-5.3 Instant 默认、GPT-5.4 Thinking/Pro、GPT-5.5、GPT-5.6 并存)。给团队写 SOP 时注意区分,运营同学用的是 App 端。

T4 本地档(开放权重)

模型规模适合什么许可
Qwen38B / 14B(普通显卡)· 30B-A3B MoE(约 24GB 显存)中文电商场景的默认首选,多语言强Apache 2.0
Qwen3-235B-A22B235B MoE当前开放权重里综合基准最强Apache 2.0
Qwen3-Coder-480B480B MoE写数据管道/自动化脚本(SWE-bench Verified 69.6%)Apache 2.0
Gemma 3 27B27B单张大显存卡即可跑,通用任务稳Gemma 许可
DeepSeek R1需要推理链的任务(MATH-500 97.3%)MIT

跑法:装 Ollama 或 LM Studio,ollama run qwen3:8b 直接拉量化 GGUF 并暴露一个 OpenAI 兼容的本地接口——意味着上面所有用 OpenAI SDK 写的示例代码,改一个 base_url 就能指向本地。高并发生产环境用 vLLM,纯 CPU/边缘设备用 llama.cpp。显存不够就降量化位数(Q4 及以下),代价是质量下降。

详细部署步骤见 B5 本地模型部署

视频生成

模型强在哪电商用途
Veo 3.1(Google Flow)电影感 + 原生音频生成需要成片质感、带声音的广告片
Runway Gen-4.5剪辑控制强,团队协作友好需要精细创意控制的交付物
Kling 3运动真实感最好产品动态展示
Seedance 2图生视频 + 长镜头规划广告、品牌场景、分镜驱动的制作

电商场景最重要的一条经验:产品本身永远用图生视频(从真实产品照出发),不要用文生视频。文生视频会重新“想象“你的产品,细节、比例、logo 都会变,拿去做广告素材是合规风险。

OpenAI 的 Sora 2 已不在推荐之列——消费端于 2026-04 结束,API 定于 2026-09-24 停用。如果你的流程里还依赖它,需要迁移。

图像生成

模型强在哪电商用途
Nano Banana Pro(Google)photorealism + 图上文字 + 多语言产品图、带文案的营销图、多市场本地化素材
FLUX.2 Pro照片级产品图,API 走量高频出图的自动化 Pipeline
GPT Image 2复杂指令遵循最好一次描述清楚多个约束的场景图
Midjourney V8.1审美上限最高品牌调性图、Lifestyle 场景
Ideogram 4排版与文字需要精确文字的 Banner
Recraft V4.1设计系统/矢量图标、品牌视觉规范

“最好的图像模型“已经不存在单一答案。实践中的组合是:走量用 FLUX.2 Pro 或 Nano Banana Pro 接 API,需要审美把关的主图用 Midjourney 人工筛,需要精确文字的用 Ideogram。详见 A7 视觉内容B9 AI 图片 Pipeline


怎么自己复核这张表

这张表会过期,下面是自查步骤(建议每季度做一次,10 分钟):

  1. 官方定价页(唯一可信来源,第三方对比站普遍滞后)
  2. 官方模型列表页看有没有新档位、老型号有没有标 deprecated
  3. 开放权重榜单看 T4 档换代:Hugging Face 的开源榜、LMArena
  4. 改完把本页顶部的校验日期一并更新,并在下方变更记录里加一行

判断“要不要动正文“的标准很简单:只要档位划分没变,正文一个字都不用改。 只有当出现了一个现有四档装不下的新形态(比如某个厂商推出专门的电商垂直模型),才需要回头调整正文表述。


变更记录

日期变更
2026-07-31建立本页。全库正文改为能力档位表述,型号引用统一回链此处
2026-07-31补入视频生成档;标注 Sora 2 已弃用(消费端 2026-04 结束,API 2026-09-24 停用)