你好奇过为什么本地部署大模型不消耗token么

你有听说过把大语言模型下载到本地,然后在本地运行,你问他任何问题不消耗token 么。

准确的说法是,本地部署AI,仍然消耗 token,只不过你自己不为消耗的 token 花钱而已。

token 是大语言模型类 AI 处理信息的基本单位。我们自己的主流媒体给他的定义为“词元”,但貌似没人这么用。

大语言模型类 AI 工作的原理是碰撞概率,你向 ai 发出的问题,会先被分割成一个一个 token(类似编码),token 被计算机理解后(类似解码),再通过概率体系逐个生成结果,但是这个结果也是以 token 的单位输出。所以无论你是在本地运行大语言模型的 ai,还是在云端访问大厂的 ai,都是要走这么一个过程。

通过客户端、云端使用 ai,消耗的是人家的显卡、内存、电、运营,你要为此付费。在本地运行,消耗的是你自己的显卡和内存,显卡和内存在吞吐token,前者是你租用人家的资源获得结果,你要为此付费,后者是显卡和内存你自己买好了,消耗的过程不用再付费。

这有点像”点外卖”和”在家做饭”的区别。叫外卖你按份付钱(类似按 token计费的),在家做饭不用付给餐厅钱,但你得自己买锅买灶(硬件)、交燃气水电费(电费),还得自己动手(时间精力)。饭该做还是要做(token 该处理还是要处理),只是账单的形式变了。

本地部署时,模型下载到你自己的电脑上,概率碰撞完全跑在你自己的硬件上,没有任何请求发往外部服务器。既然没有第三方在为你提供算力,自然也就没有人向你收费。你付出的成本就是一次性的硬件投入、电费和自己的时间。

本地部署仍然消耗token,只是不产生第三方计费,成本从按使用量付费转移到你自己承担的硬件和电力精力上。

David