沃创 Field Notes · 第二期 · 2026年8月
您的企业到底该用哪个AI模型?
前两节完整免费,就在下方。包含成本模型与八月定价全景的完整指南,199美元。
多数模型选型从一张排行榜开始,以一笔没人预料到的账单结束。做决定时参考的那个基准测试,测的是您的业务根本不做的事;比价时按每百万token计算,而您真正的计价单位是"解决一次客户请求"。至于切换成本,所有人都默认它接近于零,直到真要切换的那天。
这份指南讲的是商业决策本身,不是用来衡量它的那张计分卡。它假定您经营着一家五十到一千人规模的公司,手上有一到五个场景适合让模型发挥价值,并且没有一支研究团队能陪您做半年的模型评测。它还假定,您最终得向一位CFO解释这个选择,而对方并不关心哪个模型赢了数学竞赛。
第一节和第二节完整刊载于下方。无需留邮箱,没有任何需要解锁的内容。
一、模型选型其实是第二个问题
第一个该问的问题是:这项工作到底是什么,也就是所谓的"待完成的任务"(Jobs to be Done,JTBD)。模型选型是这个描述的结果,而这个领域里几乎每一个昂贵的错误,追溯到最后都是在把任务讲清楚之前就先把模型定了。
其中大部分错误来自三种模式。
照着一个与您的工作并不相像的基准测试来挑。公开基准测试衡量的是困难、通用、经过对抗性筛选的问题,因为只有这样它才适合用来比较前沿研究。而您的客服工单分流工作,这三条一条都不沾。一个在研究生水平推理基准上高出三分的模型,在您的任务上可能表现完全一样,甚至更差,如果您的任务奖励的是遵循指令和格式纪律,而不是推理深度。排行榜量的是另一项运动。
让一个模型统一承担四种不同的工作。组织倾向于只选一家供应商,因为采购流程更简单,架构图也更整齐。然后就会出现这种局面:同一个模型用来给客户来信分类绰绰有余,用来起草一封技术回复却又力有不逮,于是您在一项任务上多花了钱,在另一项任务上没做好事。统一供应商是一项真实的收益,但它不是免费的。
把这个决定当成永久性的。这个市场重新定价和重新发布的节奏以月计。任何按三年周期做出的选择,都会在三年到来之前很久就已经错了。正确的姿态是:一个默认模型,一条应急通道,以及一个足够低的切换成本,低到重新审视这个决定只是某个周二的事,而不是一个项目。
最后这一点,是值得贯穿本指南其余部分的重新框定。您选的不是一个模型。您选的是一个默认项、一条处理默认项做不好的情况的升级路径,以及一套让您能够替换其中任何一个而不必重写系统的架构。
二、真正影响成本与风险的七项标准
就一个商业决策而言,关于模型的一切重要问题,都可以归结为七个。每一个都配有一项不需要数据科学团队就能跑的检验。
任务契合度
在您自己的数据上衡量,这个模型是否把您这项具体的工作做好了。
检验方法:从上个月的真实工作里挑出一百个真实样本,每一个都附上已知的正确结果。如果您一天之内攒不出这个集合,说明您对这项任务的理解还不足以为它选模型,再多的供应商比价也救不回来。这个集合是整个过程中您将建立起来的最有价值的资产,第七节讲的就是怎么用它。
延迟容忍度
在价值开始衰减之前,这个答案可以等多久。
检验方法:问一句:等待的时候,那个人在做什么。如果他坐在那里盯着光标,您买的是第95百分位响应时间,而且应当在并发条件下测量它,不是在一场安静的演示里。如果这项工作是夜间批量跑的,延迟几乎是免费的,您只需要比价。这两种情况会指向不同的模型和不同的价格,而团队常常为那个夜间任务买下了昂贵的那个答案。
上下文需求
模型必须一次性装下多少输入。
检验方法:在真实流量里量出输入长度的第95百分位。多数团队是按一个想象中的最坏情况采购的,而那种情况在实际请求里出现不到百分之一,代价是每一次调用都在为这份余量付费。如果长尾确实需要更大的窗口,把长尾路由到另一个模型,而不是为了它给所有请求都买下天花板。
工具与集成需求
模型是否需要调用您的系统,以及调用得有多可靠。
检验方法:数一数您有多少任务需要模型去调用某个东西,而不只是生成文本;再数一数其中需要串起多次调用的,和只需一次调用就够的。单次工具调用已经接近一个被解决的问题。真正拉开模型差距的是多步链条,每一步都依赖上一步的那种,而那也正是便宜模型以失败重跑的形式悄悄变贵的地方。
数据驻留与合规
您被允许发送什么,以及这些数据可以在哪里被处理。
检验方法:找出您手上条款最严的那份客户合同,读它关于次级处理方和数据存放地的规定。划定边界的是那份合同,不是您自己的心理舒适区。如果新增一家次级处理方必须先通知客户,那就是一条采购时间线,它应该在您爱上某家供应商之前就进入计划。
切换成本
把产品背后的模型换掉,需要多长时间。
检验方法:问您的工程负责人,换掉模型并重新验证需要几天。如果没人知道,诚实的答案是比您以为的更久,而把这个数字降下来,比多拿到一点边际能力更有价值。第八节讲怎么让它保持在低位。
每完成一项任务的总成本
一个单位的完成品,实际上要花多少钱。
这是最常被算错的一项标准,它单独占一节。
另外六节讲了什么
标准您已经有了。您还没有的是全部的算术,而反直觉的结论恰恰都在算术里。下面直说三个,好让您自己判断其余部分值不值199美元:
便宜的模型通常是更贵的选择。当前市场上每次推理的单价,最高与最低之间相差约56倍。把一位客服人员的成本摆在这个价差旁边,它立刻塌缩成一个舍入误差。第四节算给您看:从最便宜的开源模型升级到最贵的前沿模型,只要后者能多解决三分之一个百分点的工单而无需人工介入,这笔升级就已经回本。不是三个百分点,是三分之一个百分点。
完全相同的开源权重,因托管方不同,价格可以相差十倍。同一份Llama 3.3 70B权重,在同一天里,一家托管方每百万输入token收0.10美元,另一家收1.04美元。第六节列出各家托管方的完整价差,这意味着任何一次现有部署的成本复盘,第一步该查的是托管方,而不是模型。
自建部署几乎一定更贵。第三节把"租GPU"和"按token付费"之间的盈亏平衡点算了出来,落在每月约950万次请求、且全天候持续的水平上。低于这个量,而绝大多数中型企业的负载远低于它,自己租硬件就是更贵的那个选项,而且差距不小。
付费版包含什么
三 · 开源还是闭源,各自到底把你绑定在什么上
含以当前GPU与每token费率算出的利用率盈亏平衡点,以及多数团队应当选择、却让争论双方都不满意的那条中间路线。
四 · 每完成一项任务的成本
唯一重要的计价单位,含完整成本表、回本所需的分流率测算,以及会让结论反转的三个条件。
五 · 决策框架
把工作负载与真正起决定作用的那项约束对应起来,以及为什么正确答案通常是两个模型而不是一个。
六 · 模型全景,2026年8月
市面上常见的闭源与开源模型逐一列出,含输入输出价格、上下文窗口与部署注意事项。覆盖Anthropic、OpenAI、Google、DeepSeek、Qwen、Llama、Gemma与GPT-OSS系列,另有各托管方的价差、自建部署的GPU费率,以及网关这一类别。每一个数字都注明来源页面与采集日期。
七 · 如何在两周内完成评测
不需要数据科学团队,含让结果具备统计意义的样本量,以及那些只在生产负载下才会现形的失效模式。
八 · 六个月后该重新审视什么
值得重新谈判的合同条款,以及让切换成本保持低位的三个习惯。
199美元。一份标注日期的PDF,邮件交付。第一版,2026年8月。
PDF正文为英文。本页刊载的前两节是中文,完整版目前只有英文版本。这一点写在付款按钮上方,而不是收据里。
如果它没有改变您原本要做的某个决定,收到收据后七天内回复邮件,我全额退款,不问缘由。
交付方式为邮件发送,发件地址是[email protected],通常几小时内送达,最迟不超过一个工作日。如果没有收到,写信到[email protected],我们会立刻补发。
第六节是一份标注日期的快照,几个月内就会过时,指南里也是这么写的。第三到五节、第七节和第八节才是耐久的部分,也是买这份指南的理由。
还不打算购买?
付费版会在市场变化到值得出新一期时发布。留下邮箱,您会收到下一期的发布通知,以及每一期免费版上线时的提醒。
已加入名单。下一期的发布通知会发到该邮箱。其间有任何问题:[email protected]。
利益披露
Erick Watson曾任Chainlodge的联合创始人兼CFO,该公司是一处面向AI算力负载的数据中心园区,已于2026年结束运营。付费版第三节和第四节讨论自建部署与算力采购,而沃创在这个市场里有商业利益。这一点应当在您读到那些建议之前就知道,而不是之后。
作者是谁
Erick Watson做过那种做错了就很贵的生产级AI产品。他曾为一个对全美1.05亿户家庭逐一运行推理的AI估值平台负责产品,该平台在自动估值准确度上排名全美第一;也曾在Elevance Health为3400万+会员构建数据产品;并通过Chainlodge,从供给侧观察当下的AI算力市场。这份指南,是他与运营者反复进行的那场选型对话,写下来一次。
