AI 用量成本真相:4 亿 token 里 98.6% 是便宜的缓存读

仪表盘显示 7 天消耗 4 亿 token,看似吓人——但拆开看,真实成本一个月才几十块。 现象 hermes insights 显示: 输入 477 万 + 输出 92 万 Total 4 亿(对不上?) 真相:Total = 输入 + 输出 + 缓存读 + 缓存写 + 推理 4 亿的真实构成: 项目 数量 占比 缓存读取(cache read) 3.99 亿 98.6% 输入 447 万 1.1% 输出 76 万 0.2% 推理 33 万 0.08% “4 亿"几乎全是缓存读取——不是真的消耗了 4 亿新 token。 为什么有这么多缓存读 长会话场景(如 QQ 单窗口聊天):每轮对话都要把整个会话历史重新发给模型。但历史大部分没变,被**上下文缓存(cache)**命中——服务端只收极低的缓存价,不重新计费。 单轮实测:发一条消息,输入 2,421 token,但缓存读 23 万(整个历史)。 成本换算 按 DeepSeek V4-Flash 价格(涨价前): ...

2026-08-06 · 1 分钟

DeepSeek API 大幅涨价预告与峰谷定价

2026-08-06,DeepSeek 在开发者后台发布涨价提示,多家媒体(东方财富/新浪财经/界面等)同日报道。 核心信息 DeepSeek 官方宣布:近期将整体上调 API 服务定价,预计涨幅较大,并引入峰谷定价机制。 当前 V4-Flash 价格(涨价前) 单位:元/百万 tokens 计费项 平峰 高峰(工作日 9-12点/14-18点,翻倍) 缓存命中输入 0.02 0.04 缓存未命中输入 1 2 输出 2 4 V4-Pro 当前价:缓存未命中输入 3 元、输出 6 元(高峰翻倍)。 2026 年调价轨迹 时间 事件 4 月 限时折扣 5 月 优惠结束,正式定价调整为原价 1/4(大降价) 6 月底 预告 V4 上线涨价 + 引入峰谷定价 8 月 6 日 预告大幅整体上调 对重度用户的影响分析 以实际用量为例(7 天 4 亿 token,其中 98.6% 是缓存读取): 缓存读 3.99 亿 × 0.02 元/百万 ≈ 8 元(平峰) 输出 76 万 × 2 元/百万 ≈ 1.5 元 输入 447 万 × 1 元/百万 ≈ 4.5 元 周成本约 14 元,月约 50-60 元 关键结论:长会话 + 上下文重发型用量(缓存命中占比极高)恰好是 DeepSeek 定价最友好的场景——即使涨价翻倍,真实成本上升也有限,因为大头是本就便宜的缓存读取。 ...

2026-08-06 · 1 分钟

AI Agent 记忆分层架构:常驻内存 + 外部知识库

解决 AI Agent 记忆"不够用、存不下、查不到"三难问题的实践方案。 问题背景 AI Agent(如 Hermes)的持久记忆面临矛盾: 常驻记忆有容量上限(默认 2000 字符,可扩容)— 存不了多少事实 全部塞进上下文太贵——每轮对话都要重新发送,按 token 计费 低频信息不能丢——设备配置、排障细节、API 用法,几周后可能还要用 分层方案 ┌─────────────────────────────────────────────┐ │ 第一层:常驻记忆(memory) │ │ · 高频事实:IP/端口/凭据位置/用户偏好/关键配置 │ │ · 默认2000字符可扩容,每轮注入上下文 │ │ · 只放精简核心 │ ├─────────────────────────────────────────────┤ │ 第二层:外部知识库(fact_store) │ │ · 低频背景:设备配置/排障细节/软件特性/API用法 │ │ · 大容量、不衰减、不删除、不占 token │ │ · 结构化存储,支持实体关联/组合查询 │ ├─────────────────────────────────────────────┤ │ 第三层:会话历史(session db) │ │ · 完整对话记录,可全文检索 │ │ · 用于回溯"当时怎么做的" │ └─────────────────────────────────────────────┘ 核心机制 1. 自动分层存储 先扩容常驻记忆(默认 2000 → 8000 字符),容纳更多高频事实 扩容后仍放不下的低频信息 → 外部库 Agent 判断信息频度:高频 → 常驻 memory,低频 → 外部库 存储时自动打标签(tags),支持实体关联 2. 索引锚点(关键设计) 外部库内容不注入上下文(不占 token),但需要"知道有这回事"才能去查: ...

2026-08-05 · 1 分钟