<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Token on TechLog 技术日志</title><link>https://techlog.122113.xyz/tags/token/</link><description>Recent content in Token on TechLog 技术日志</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Thu, 06 Aug 2026 23:00:00 +0800</lastBuildDate><atom:link href="https://techlog.122113.xyz/tags/token/index.xml" rel="self" type="application/rss+xml"/><item><title>AI 用量成本真相:4 亿 token 里 98.6% 是便宜的缓存读</title><link>https://techlog.122113.xyz/posts/2026-08-06-token-cost-truth/</link><pubDate>Thu, 06 Aug 2026 23:00:00 +0800</pubDate><guid>https://techlog.122113.xyz/posts/2026-08-06-token-cost-truth/</guid><description>&lt;blockquote&gt;
&lt;p&gt;仪表盘显示 7 天消耗 4 亿 token,看似吓人——但拆开看,真实成本一个月才几十块。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id="现象"&gt;现象&lt;/h2&gt;
&lt;p&gt;&lt;code&gt;hermes insights&lt;/code&gt; 显示:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;输入 477 万 + 输出 92 万&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Total 4 亿&lt;/strong&gt;(对不上?)&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="真相total--输入--输出--缓存读--缓存写--推理"&gt;真相:Total = 输入 + 输出 + 缓存读 + 缓存写 + 推理&lt;/h2&gt;
&lt;p&gt;4 亿的真实构成:&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;项目&lt;/th&gt;
&lt;th&gt;数量&lt;/th&gt;
&lt;th&gt;占比&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;缓存读取(cache read)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;3.99 亿&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;98.6%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;输入&lt;/td&gt;
&lt;td&gt;447 万&lt;/td&gt;
&lt;td&gt;1.1%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;输出&lt;/td&gt;
&lt;td&gt;76 万&lt;/td&gt;
&lt;td&gt;0.2%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;推理&lt;/td&gt;
&lt;td&gt;33 万&lt;/td&gt;
&lt;td&gt;0.08%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;&amp;ldquo;4 亿&amp;quot;几乎全是缓存读取&lt;/strong&gt;——不是真的消耗了 4 亿新 token。&lt;/p&gt;
&lt;h2 id="为什么有这么多缓存读"&gt;为什么有这么多缓存读&lt;/h2&gt;
&lt;p&gt;长会话场景(如 QQ 单窗口聊天):每轮对话都要把&lt;strong&gt;整个会话历史&lt;/strong&gt;重新发给模型。但历史大部分没变,被**上下文缓存(cache)**命中——服务端只收极低的缓存价,不重新计费。&lt;/p&gt;
&lt;p&gt;单轮实测:发一条消息,输入 2,421 token,但&lt;strong&gt;缓存读 23 万&lt;/strong&gt;(整个历史)。&lt;/p&gt;
&lt;h2 id="成本换算"&gt;成本换算&lt;/h2&gt;
&lt;p&gt;按 DeepSeek V4-Flash 价格(涨价前):&lt;/p&gt;</description></item></channel></rss>