2025年3月的一个周二晚上,老周打开云厂商后台,盯着那张账单看了两分钟。
同一个AI客服产品,同样的日均调用量。2023年他一个月付4.2万,现在账单上是3860块。
降了91%。他一点都高兴不起来。
14块跌到5毛,只用了两年
2023年3月,gpt-3.5-turbo 的报价是 0.002 美元/千token,折成人民币,百万token差不多14块钱。那会儿国内做AI应用的,谁敢把调用量做大,谁就是在烧钱。
然后事情开始失控。
2024年5月,字节把豆包 pro-32k 挂到 0.8元/百万token。同一个月,阿里通义 qwen-long 报 0.5元。百度的 ERNIE Speed 和 ERNIE Lite 干脆免费。到 DeepSeek 这儿更狠——缓存命中的那部分输入,5毛钱一百万个 token。
两年,97%。没有哪个行业的报价单是这么往下砸的。
这笔账其实很好算
一台8卡 H20 的整机,2024年底的行情,含税110万上下。
按三年折旧,一个月3万。机房托管、电费、带宽,一个月一万出头。加起来四万块的固定支出,跟有没有人用没关系——卡插在那儿,电就在跑。
那么问题来了:四万块一个月,得摊出多少 token,才能把单位成本压到一块钱以下?
我按最理想的算过一遍。一天得吐出十亿个 token,八张卡一刻不停地跑,连续批处理拉满,KV cache 一点不浪费。
而现实里,绝大多数客户的 GPU 利用率在 30% 上下晃。你按三成算,单位成本立刻翻三倍还多。
得了吧。0.8元/百万token,那不是定价,那是入场券。
降价的真相,是航空公司的套路
飞机起飞前两小时的座位,卖不卖?卖。反正油钱已经付了,多一个乘客只多一份飞机餐。
云厂商的算力是同一个逻辑。卡买回来了,折旧已经在走,空转就是纯亏。边际成本这时候只等于电费——电费才几个钱?
低价不是为了赚钱,是为了填谷。白天卖给训练任务和高价值客户,凌晨两点卖给跑批的、跑数据清洗的、跑爬虫的。
这叫什么?这叫用投资人的钱,把闲置算力换成分额。
至于能不能回本——没人关心。2024年一级市场砸进大模型赛道的钱,够这些厂商烧很多年。他们赌的不是今年赚钱,是赌牌桌上其他人先离场。
最难受的,是夹在中间那批人
老周就是。
他的AI客服卖给中小电商,年费三万八。这个价怎么定出来的?2023年他算过:API调用成本占营收35%,人力占30%,剩下的是毛利。
现在API成本占营收不到4%。按理说,他该笑出声。
但他笑不出来。
因为客户也上网,也看新闻。上个月一个做家具的老板直接在电话里问他:“你们那个大模型,我看新闻说五毛钱一百万字,你收我三万八,图啥呢?”
他解释了半天:脏活是我们干的。话术得按他的SKU重写,退货规则得跟平台接口对上,客户骂人的方言得单独做语料。这些活儿大模型自己干不了。
老板最后说,行,那降一万。
那张报价单,只保留48小时
上周五下午五点四十,云厂商的销售给他发来一份新报价。
“老周,这个价格只保留到周一。签不签?”
他点开看了一眼。比他上个月拿到的,又低了18%。
他知道这是什么意思。对面也快到季度末了。
他关掉聊天窗口,打开那个一直没删的Excel——去年做的2026年财务预测,里面写着“API成本按当前价上浮10%计算”。
他把那行删了。然后开始重新填数字。
十二点十四分,他给销售回了两个字。
“签吧。”
评论 0
留下你的看法