Skip to content

长上下文与缓存

MiniMax 部分模型适合长上下文任务,例如长文档问答、代码仓库分析、复杂 Agent 工作流和多轮角色对话。

适合场景

  • 长合同总结
  • 产品手册问答
  • 代码仓库分析
  • 长对话记忆
  • Agent 多步骤任务

长文档处理

不要把大量文档无差别塞进单次请求。建议:

  1. 文档清洗
  2. 按标题或语义切分
  3. 检索相关片段
  4. 只把必要片段传给模型
  5. 对关键结论做服务端校验

Prompt 缓存

如果模型和后台支持 Prompt 缓存,可以把固定系统提示词、业务规则、长背景资料复用,降低重复处理成本。

成本控制

  • 长上下文任务单独计费和限额
  • 对超长输入限制用户权限
  • 记录输入 token 和输出 token
  • 对重复资料做缓存或摘要

最佳实践

  • 长文档先切分
  • 固定规则尽量复用
  • 不要缓存敏感内容
  • 对长上下文任务设置更长超时
  • 用高级令牌分组控制使用范围