avatar

Neo·元

算法的尽头,认知的倒影

  • 首页
  • 三千问道
  • 万法归宗
  • 诗酒田园
  • 关于Neo·元
主页 Token 暴涨、上下文爆炸的 5 种真实业务优化
文章

Token 暴涨、上下文爆炸的 5 种真实业务优化

发表于 2026-07-31 更新于 2026-07- 31
作者 Neo
1~1 分钟 阅读

做大模型应用,最容易被忽视但最致命的问题就是 Token 爆炸。很多项目原型跑得很好,一上线就崩,不是模型不行,而是上下文直接撑爆。

固定做 5 件事,基本能把 Token 压到原来的 1/3 甚至更少。

第一,历史对话必须截断。没有人需要无限长的上下文,保留最近 5~10 轮足够。

第二,系统提示词精简。很多人写几百字的提示词,其实真正有用的就两三句。我现在一般控制在 50 字以内。

第三,长文档不直接塞模型。用向量检索,只取最相关的两三段,既省 Token 又提高准确度。

第四,历史对话做摘要。旧的消息不保留原文,只保留摘要,能再砍掉一半。

第五,限制输出长度。模型一旦说废话,不仅慢,还贵,还容易超出限制。

这些优化都不需要改模型、不需要训练、不需要高深技术,直接上线就能见效。

我在多个私有化项目里验证过,优化前和优化后完全是两个世界。速度快、成本低、服务稳、不易崩。

很多开发者觉得优化 Token 是小事,等真正线上炸了才知道,这是决定项目能不能落地的关键。

万法归宗
许可协议:  CC BY-NC 4.0
分享
本文同步发布于个人博客 Neo·元,转载请注明出处。

相关文章

9月 10, 2026

深入底层与生产落地:LangGraph 状态机机制与高性能流式优化

前言 最近回过头重新审视并优化了之前的 LangGraph 项目。随着对大模型工程化与 Agent 架构理解的加深,发现不少早期写得不够优雅、甚至隐藏着生产风险的地方。本文不谈虚无缥缈的概念,我直接从底层机制进行拆解:MessagesState 的追加本质、RunnableConfig 的真实作用、

9月 3, 2026

浅谈 LangGraph 智能体演进:从 Ollama到 DeepSeek-R1的踩坑与架构重构

前言 在本地部署大模型开发Agent项目,基于现有硬件环境和调试成本考量,优先使用的是基于Ollama部署的3B/7B模型。但当业务进入“海关风控与跨境物流”这种对指令遵循、工具调用以及人工干预有绝对硬红线的真实场景时,小模型的劣势会被无限放大。 本文记录了我将一个 LangGraph Agent

9月 1, 2026

浅谈 HITL 与 Checkpointer

前言 本地跑通了 Multi-Agent 之后,我一直在想,企业级 AI 应用的两个关键技术还没真正用上:一个是 HITL(Human-in-the-Loop,人工介入),一个是 Checkpointer(状态持久化与回滚)。正好最近在研究跨境物流报关场景——这个领域因为涉及海关监管,人工审核是硬性

下一篇

SSE 流式返回不稳定问题彻底解决

上一篇

中小企业私有化大模型硬件配置实战

最近更新

  • 深入底层与生产落地:LangGraph 状态机机制与高性能流式优化
  • 浅谈 LangGraph 智能体演进:从 Ollama到 DeepSeek-R1的踩坑与架构重构
  • 浅谈 HITL 与 Checkpointer
  • 聊一下 LangGraph 的流式打印
  • 调试 Cursor 与 Claude Code

热门标签

Tools DeepSeek AI LangChain RAG LangGraph

©2026 All Rights Reserved Neo 鲁ICP备2026037083号