翰廷文化 Ai开启未来

每百万token五毛钱,大模型价格战打了两年,谁在流血,谁在清场

成本降了91%,夹在中间的创业者却更慌了——每一次降价,都是在把中间商往墙角推。

返回列表

每百万token五毛钱,大模型价格战打了两年,谁在流血,谁在清场

2025年3月的一个周二晚上,老周打开云厂商后台,盯着那张账单看了两分钟。

同一个AI客服产品,同样的日均调用量。2023年他一个月付4.2万,现在账单上是3860块。

降了91%。他一点都高兴不起来。

14块跌到5毛,只用了两年

2023年3月,gpt-3.5-turbo 的报价是 0.002 美元/千token,折成人民币,百万token差不多14块钱。那会儿国内做AI应用的,谁敢把调用量做大,谁就是在烧钱。

然后事情开始失控。

2024年5月,字节把豆包 pro-32k 挂到 0.8元/百万token。同一个月,阿里通义 qwen-long 报 0.5元。百度的 ERNIE Speed 和 ERNIE Lite 干脆免费。到 DeepSeek 这儿更狠——缓存命中的那部分输入,5毛钱一百万个 token。

两年,97%。没有哪个行业的报价单是这么往下砸的。

这笔账其实很好算

一台8卡 H20 的整机,2024年底的行情,含税110万上下。

按三年折旧,一个月3万。机房托管、电费、带宽,一个月一万出头。加起来四万块的固定支出,跟有没有人用没关系——卡插在那儿,电就在跑。

那么问题来了:四万块一个月,得摊出多少 token,才能把单位成本压到一块钱以下?

我按最理想的算过一遍。一天得吐出十亿个 token,八张卡一刻不停地跑,连续批处理拉满,KV cache 一点不浪费。

而现实里,绝大多数客户的 GPU 利用率在 30% 上下晃。你按三成算,单位成本立刻翻三倍还多。

得了吧。0.8元/百万token,那不是定价,那是入场券。

降价的真相,是航空公司的套路

飞机起飞前两小时的座位,卖不卖?卖。反正油钱已经付了,多一个乘客只多一份飞机餐。

云厂商的算力是同一个逻辑。卡买回来了,折旧已经在走,空转就是纯亏。边际成本这时候只等于电费——电费才几个钱?

低价不是为了赚钱,是为了填谷。白天卖给训练任务和高价值客户,凌晨两点卖给跑批的、跑数据清洗的、跑爬虫的。

这叫什么?这叫用投资人的钱,把闲置算力换成分额。

至于能不能回本——没人关心。2024年一级市场砸进大模型赛道的钱,够这些厂商烧很多年。他们赌的不是今年赚钱,是赌牌桌上其他人先离场。

最难受的,是夹在中间那批人

老周就是。

他的AI客服卖给中小电商,年费三万八。这个价怎么定出来的?2023年他算过:API调用成本占营收35%,人力占30%,剩下的是毛利。

现在API成本占营收不到4%。按理说,他该笑出声。

但他笑不出来。

因为客户也上网,也看新闻。上个月一个做家具的老板直接在电话里问他:“你们那个大模型,我看新闻说五毛钱一百万字,你收我三万八,图啥呢?”

他解释了半天:脏活是我们干的。话术得按他的SKU重写,退货规则得跟平台接口对上,客户骂人的方言得单独做语料。这些活儿大模型自己干不了。

老板最后说,行,那降一万。

那张报价单,只保留48小时

上周五下午五点四十,云厂商的销售给他发来一份新报价。

“老周,这个价格只保留到周一。签不签?”

他点开看了一眼。比他上个月拿到的,又低了18%。

他知道这是什么意思。对面也快到季度末了。

他关掉聊天窗口,打开那个一直没删的Excel——去年做的2026年财务预测,里面写着“API成本按当前价上浮10%计算”。

他把那行删了。然后开始重新填数字。

十二点十四分,他给销售回了两个字。

“签吧。”

评论 0

留下你的看法