Skip to content

性能与成本优化

MiniMax 接入时应根据任务质量、上下文长度和延迟要求选择模型。highspeed 版本适合低延迟,标准版本适合质量优先场景。

模型分层

任务推荐
普通聊天MiniMax-M2.8
低延迟聊天MiniMax-M2.8-fast
长上下文分析MiniMax-M2.8
角色对话M2-her

优化建议

  • 简单任务使用 highspeed 或低成本模型
  • 长上下文任务单独限额
  • 角色对话控制历史长度
  • 缓存固定背景资料
  • 记录每个模型的延迟、错误率和成本

令牌分组建议

  • 默认分组开放通用模型
  • 高级分组开放长上下文模型
  • 测试分组用于新模型灰度
  • 企业分组可配置独立额度和并发