长上下文与缓存
MiniMax 部分模型适合长上下文任务,例如长文档问答、代码仓库分析、复杂 Agent 工作流和多轮角色对话。
适合场景
- 长合同总结
- 产品手册问答
- 代码仓库分析
- 长对话记忆
- Agent 多步骤任务
长文档处理
不要把大量文档无差别塞进单次请求。建议:
- 文档清洗
- 按标题或语义切分
- 检索相关片段
- 只把必要片段传给模型
- 对关键结论做服务端校验
Prompt 缓存
如果模型和后台支持 Prompt 缓存,可以把固定系统提示词、业务规则、长背景资料复用,降低重复处理成本。
成本控制
- 长上下文任务单独计费和限额
- 对超长输入限制用户权限
- 记录输入 token 和输出 token
- 对重复资料做缓存或摘要
最佳实践
- 长文档先切分
- 固定规则尽量复用
- 不要缓存敏感内容
- 对长上下文任务设置更长超时
- 用高级令牌分组控制使用范围