Skip to content

成本与性能优化

ChatGLM / GLM 接入时应根据任务质量、延迟、视觉能力和成本选择模型。

模型分层

任务推荐
普通聊天glm-5.1-air
低延迟聊天glm-5-flash
批量分类flash / turbo 模型
图像理解GLM-V 系列

优化建议

  • 简单任务使用 turbo 或 flash 模型
  • 高价值任务使用旗舰模型
  • 视觉任务单独限额
  • 控制多轮历史长度
  • 记录每个模型的延迟、错误率和成本

令牌分组建议

  • 默认分组开放通用模型
  • 高级分组开放旗舰和视觉模型
  • 测试分组用于新模型灰度
  • 企业分组可配置独立额度和并发