Token 暴涨、上下文爆炸的 5 种真实业务优化
做大模型应用,最容易被忽视但最致命的问题就是 Token 爆炸。很多项目原型跑得很好,一上线就崩,不是模型不行,而是上下文直接撑爆。
固定做 5 件事,基本能把 Token 压到原来的 1/3 甚至更少。
第一,历史对话必须截断。没有人需要无限长的上下文,保留最近 5~10 轮足够。
第二,系统提示词精简。很多人写几百字的提示词,其实真正有用的就两三句。我现在一般控制在 50 字以内。
第三,长文档不直接塞模型。用向量检索,只取最相关的两三段,既省 Token 又提高准确度。
第四,历史对话做摘要。旧的消息不保留原文,只保留摘要,能再砍掉一半。
第五,限制输出长度。模型一旦说废话,不仅慢,还贵,还容易超出限制。
这些优化都不需要改模型、不需要训练、不需要高深技术,直接上线就能见效。
我在多个私有化项目里验证过,优化前和优化后完全是两个世界。速度快、成本低、服务稳、不易崩。
很多开发者觉得优化 Token 是小事,等真正线上炸了才知道,这是决定项目能不能落地的关键。
许可协议:
CC BY 4.0