每一条回复,钱花到哪里去了
一条回复的成本,从不到一分钱到几分钱不等,取决于模型的大小和长度。这个数字,就单条消息而言很小,但乘以几百万条就变得庞大,这就是为什么免费服务会在意重度用户,也是为什么成本塑造了使用上限、排队机制,以及你实际用到的模型。
关于免费AI聊天工具的大多数争论,其实都是关于一个没有人说出口的数字的争论。这个数字并不是秘密,它解释了这个品类里几乎每一款产品的设计。
成本就是硬件时间
生成文字,会在回复的时长内占用一块图形处理器。这块硬件,是按小时购买或租用的,所以一条回复的成本,就是它所用掉的那一小时的一部分。更长的回复和更大的模型,成本会按比例增加,这就是为什么这两者,往往是一个免费档位最先限制的东西。
读,比写更便宜
处理你的问题和它背后的对话,每个词的成本,比生成回复要低。这就是为什么服务对长输入比对长输出更慷慨,也是为什么一段长对话,会让成本逐渐上升,而不是突然飙升。
固定成本是另外一回事
闲置的硬件,依然要花钱,而需求在一天之内并不均匀。一项服务,要么必须为高峰期买够硬件,要么接受高峰期出现排队。这个选择,是一个成本上的决定,而它对你来说,表现为一个等候室。
为什么这个数字塑造了产品
在每条回复不到一分钱的情况下,一个轻度用户几乎不花钱,而一个重度用户,花的是实实在在的钱。因此,每一项免费服务,都是围绕着重度用户设计的:使用上限、更小的模型、更慢的排队。了解这一点,能让这些设计变得可以理解,而不是显得随意。
免费的东西也值得问清楚
成本会随时间下降吗?
会大幅下降,而需求也会随之上升。每条回复的成本大幅下降了,但总支出没有下降,因为模型和对话本身也在增长。
一个更小的模型,会便宜很多吗?
通常会便宜十倍甚至更多。这就是为什么悄悄换成一个更小的模型,是一种如此常见的控制成本的方式。
我对话的长度重要吗?
重要。之前的消息,会随每一个新请求一起重新发送,所以一段长对话,每条回复的成本,比一段短对话要高。
开始一段对话,看看这项服务会随着对话增长做出什么反应。
打开免费聊天