<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>AI on TechLog 技术日志</title><link>https://techlog.122113.xyz/tags/ai/</link><description>Recent content in AI on TechLog 技术日志</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Thu, 06 Aug 2026 23:00:00 +0800</lastBuildDate><atom:link href="https://techlog.122113.xyz/tags/ai/index.xml" rel="self" type="application/rss+xml"/><item><title>AI 用量成本真相:4 亿 token 里 98.6% 是便宜的缓存读</title><link>https://techlog.122113.xyz/posts/2026-08-06-token-cost-truth/</link><pubDate>Thu, 06 Aug 2026 23:00:00 +0800</pubDate><guid>https://techlog.122113.xyz/posts/2026-08-06-token-cost-truth/</guid><description>&lt;blockquote&gt;
&lt;p&gt;仪表盘显示 7 天消耗 4 亿 token,看似吓人——但拆开看,真实成本一个月才几十块。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id="现象"&gt;现象&lt;/h2&gt;
&lt;p&gt;&lt;code&gt;hermes insights&lt;/code&gt; 显示:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;输入 477 万 + 输出 92 万&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Total 4 亿&lt;/strong&gt;(对不上?)&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="真相total--输入--输出--缓存读--缓存写--推理"&gt;真相:Total = 输入 + 输出 + 缓存读 + 缓存写 + 推理&lt;/h2&gt;
&lt;p&gt;4 亿的真实构成:&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;项目&lt;/th&gt;
&lt;th&gt;数量&lt;/th&gt;
&lt;th&gt;占比&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;缓存读取(cache read)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;3.99 亿&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;98.6%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;输入&lt;/td&gt;
&lt;td&gt;447 万&lt;/td&gt;
&lt;td&gt;1.1%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;输出&lt;/td&gt;
&lt;td&gt;76 万&lt;/td&gt;
&lt;td&gt;0.2%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;推理&lt;/td&gt;
&lt;td&gt;33 万&lt;/td&gt;
&lt;td&gt;0.08%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;&amp;ldquo;4 亿&amp;quot;几乎全是缓存读取&lt;/strong&gt;——不是真的消耗了 4 亿新 token。&lt;/p&gt;
&lt;h2 id="为什么有这么多缓存读"&gt;为什么有这么多缓存读&lt;/h2&gt;
&lt;p&gt;长会话场景(如 QQ 单窗口聊天):每轮对话都要把&lt;strong&gt;整个会话历史&lt;/strong&gt;重新发给模型。但历史大部分没变,被**上下文缓存(cache)**命中——服务端只收极低的缓存价,不重新计费。&lt;/p&gt;
&lt;p&gt;单轮实测:发一条消息,输入 2,421 token,但&lt;strong&gt;缓存读 23 万&lt;/strong&gt;(整个历史)。&lt;/p&gt;
&lt;h2 id="成本换算"&gt;成本换算&lt;/h2&gt;
&lt;p&gt;按 DeepSeek V4-Flash 价格(涨价前):&lt;/p&gt;</description></item><item><title>DeepSeek API 大幅涨价预告与峰谷定价</title><link>https://techlog.122113.xyz/posts/2026-08-06-deepseek-pricing/</link><pubDate>Thu, 06 Aug 2026 20:30:00 +0800</pubDate><guid>https://techlog.122113.xyz/posts/2026-08-06-deepseek-pricing/</guid><description>&lt;blockquote&gt;
&lt;p&gt;2026-08-06,DeepSeek 在开发者后台发布涨价提示,多家媒体(东方财富/新浪财经/界面等)同日报道。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id="核心信息"&gt;核心信息&lt;/h2&gt;
&lt;p&gt;DeepSeek 官方宣布:&lt;strong&gt;近期将整体上调 API 服务定价,预计涨幅较大&lt;/strong&gt;,并引入&lt;strong&gt;峰谷定价&lt;/strong&gt;机制。&lt;/p&gt;
&lt;h2 id="当前-v4-flash-价格涨价前"&gt;当前 V4-Flash 价格(涨价前)&lt;/h2&gt;
&lt;p&gt;单位:元/百万 tokens&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;计费项&lt;/th&gt;
&lt;th&gt;平峰&lt;/th&gt;
&lt;th&gt;高峰(工作日 9-12点/14-18点,翻倍)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;缓存命中输入&lt;/td&gt;
&lt;td&gt;0.02&lt;/td&gt;
&lt;td&gt;0.04&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;缓存未命中输入&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;2&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;输出&lt;/td&gt;
&lt;td&gt;2&lt;/td&gt;
&lt;td&gt;4&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;V4-Pro 当前价:缓存未命中输入 3 元、输出 6 元(高峰翻倍)。&lt;/p&gt;
&lt;h2 id="2026-年调价轨迹"&gt;2026 年调价轨迹&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;时间&lt;/th&gt;
&lt;th&gt;事件&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;4 月&lt;/td&gt;
&lt;td&gt;限时折扣&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;5 月&lt;/td&gt;
&lt;td&gt;优惠结束,正式定价调整为原价 1/4(大降价)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;6 月底&lt;/td&gt;
&lt;td&gt;预告 V4 上线涨价 + 引入峰谷定价&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;8 月 6 日&lt;/td&gt;
&lt;td&gt;预告大幅整体上调&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="对重度用户的影响分析"&gt;对重度用户的影响分析&lt;/h2&gt;
&lt;p&gt;以实际用量为例(7 天 4 亿 token,其中 &lt;strong&gt;98.6% 是缓存读取&lt;/strong&gt;):&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;缓存读 3.99 亿 × 0.02 元/百万 ≈ 8 元(平峰)&lt;/li&gt;
&lt;li&gt;输出 76 万 × 2 元/百万 ≈ 1.5 元&lt;/li&gt;
&lt;li&gt;输入 447 万 × 1 元/百万 ≈ 4.5 元&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;周成本约 14 元,月约 50-60 元&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;关键结论&lt;/strong&gt;:长会话 + 上下文重发型用量(缓存命中占比极高)恰好是 DeepSeek 定价最友好的场景——即使涨价翻倍,真实成本上升也有限,因为大头是本就便宜的缓存读取。&lt;/p&gt;</description></item><item><title>AI Agent 记忆分层架构:常驻内存 + 外部知识库</title><link>https://techlog.122113.xyz/posts/2026-08-05-memory-tiered-architecture/</link><pubDate>Wed, 05 Aug 2026 22:00:00 +0800</pubDate><guid>https://techlog.122113.xyz/posts/2026-08-05-memory-tiered-architecture/</guid><description>&lt;blockquote&gt;
&lt;p&gt;解决 AI Agent 记忆&amp;quot;不够用、存不下、查不到&amp;quot;三难问题的实践方案。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id="问题背景"&gt;问题背景&lt;/h2&gt;
&lt;p&gt;AI Agent(如 Hermes)的持久记忆面临矛盾:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;常驻记忆有容量上限&lt;/strong&gt;(默认 2000 字符,可扩容)— 存不了多少事实&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;全部塞进上下文太贵&lt;/strong&gt;——每轮对话都要重新发送,按 token 计费&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;低频信息不能丢&lt;/strong&gt;——设备配置、排障细节、API 用法,几周后可能还要用&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="分层方案"&gt;分层方案&lt;/h2&gt;
&lt;pre tabindex="0"&gt;&lt;code&gt;┌─────────────────────────────────────────────┐
│ 第一层:常驻记忆(memory) │
│ · 高频事实:IP/端口/凭据位置/用户偏好/关键配置 │
│ · 默认2000字符可扩容,每轮注入上下文 │
│ · 只放精简核心 │
├─────────────────────────────────────────────┤
│ 第二层:外部知识库(fact_store) │
│ · 低频背景:设备配置/排障细节/软件特性/API用法 │
│ · 大容量、不衰减、不删除、不占 token │
│ · 结构化存储,支持实体关联/组合查询 │
├─────────────────────────────────────────────┤
│ 第三层:会话历史(session db) │
│ · 完整对话记录,可全文检索 │
│ · 用于回溯&amp;#34;当时怎么做的&amp;#34; │
└─────────────────────────────────────────────┘
&lt;/code&gt;&lt;/pre&gt;&lt;h2 id="核心机制"&gt;核心机制&lt;/h2&gt;
&lt;h3 id="1-自动分层存储"&gt;1. 自动分层存储&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;先扩容常驻记忆&lt;/strong&gt;(默认 2000 → 8000 字符),容纳更多高频事实&lt;/li&gt;
&lt;li&gt;扩容后仍放不下的低频信息 → 外部库&lt;/li&gt;
&lt;li&gt;Agent 判断信息频度:&lt;strong&gt;高频 → 常驻 memory,低频 → 外部库&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;存储时自动打标签(tags),支持实体关联&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="2-索引锚点关键设计"&gt;2. 索引锚点(关键设计)&lt;/h3&gt;
&lt;p&gt;外部库内容&lt;strong&gt;不注入上下文&lt;/strong&gt;(不占 token),但需要&amp;quot;知道有这回事&amp;quot;才能去查:&lt;/p&gt;</description></item></channel></rss>