9 月的重点是让故障转移更值得信赖,并让模型目录保持最新。我们在所有请求路径上实现了凭据感知的 provider 故障转移,在 API 响应和请求日志中展示完整的尝试历史,用最新的前沿模型刷新了目录,并把定价页面带到了中文。
凭据感知的故障转移
现在故障转移会把「凭据损坏」和「provider 故障」区分对待。当主尝试因认证错误失败时,ModelRiver 只会回退到不同的 provider —— 它不会用同一个无效的 key 去重试同一 provider 的另一个模型。如果工作流的第一个备用模型是同一 provider 的另一个模型,该备用会被跳过,转而使用下一个不同 provider 的备用模型。
本次发布的其他变化:
- 缺少或未配置 provider 凭据时,请求会直接失败,而不是静默路由到备用模型,因此配置错误会立刻暴露出来。
- 认证检测更精确:只有当 provider 的错误明确表示 key 无效或已被吊销时,403 才会被视为凭据问题,因此策略和权限拒绝不再触发跨 provider 重试。
- 同样的规则适用于同步、流式、异步和 Playground 请求,因此 Test Mode 能真实反映生产环境的路由行为。
在响应和日志中展示故障转移
现在你可以准确看到是哪个 provider 服务了请求,以及为此经历过的每一次尝试。
- API 响应新增
meta.attempts数组,包含每次尝试的 provider、模型、状态和耗时,并用meta.used_provider和meta.used_model标明最终作答的模型。错误响应也会包含尝试列表。 - 每次失败的尝试都会作为独立的请求日志条目记录,并带有尝试顺序,同时链接到最终成功的请求,因此一条时间线就能展示完整链路。
- 请求详情视图会列出失败的模型及其错误响应。
阅读 provider 故障转移尝试 了解时间线,阅读 provider 可靠性 了解如何跟踪故障转移率。
模型目录刷新
我们已把目录更新为各 provider 的当前发布版本,并同步更新了定价:
- OpenAI / Azure OpenAI: GPT-6 Astra(当前旗舰,面向最难的推理与编码任务,每百万 token $10/$50)、GPT-6 Sol(编码与 agentic,1.05M token 上下文,$2/$10)和 GPT-6 Luna(面向专注、高并发工作负载,$0.10/$0.50)。
- Anthropic: Claude Opus 5.5(自适应思考、1M 上下文、128K 输出,$4/$20)。
- xAI:
grok-4.7,当前面向编码和 agent 的旗舰($2/$6)。Grok 4.6 现为上一代旗舰。 - Google: Gemini 3.8 Flash 是面向 agentic 和多模态工作的新 GA Flash。
- DeepSeek: V4.1 Flash 取代 V4 Flash,成为聊天和高并发工作负载的多模态默认模型,现为每百万 token $0.15/$0.60。
- Groq: 新增面向安全的开源模型 Safety GPT OSS 20B,以及 Qwen 3.8 27B。
- Qwen: 新增 Qwen 3.8 系列 —— 27B(面向编码与视觉的 1M 上下文多模态模型)、2.4T A95B(开源旗舰推理模型)、Omni Flash(文本、图像、音频和视频输入),以及新的 Coder Next/Flash 和 VL Plus/Flash 模型 —— 并新增 Qwen 3.8 Max 与 3.7 的固定快照。
- Amazon Bedrock: 新增 GPT-6 Astra、Sol、Luna 以及 GPT-5.6 模型。Sol 和 Luna 运行在 Bedrock 的 OpenAI 兼容 Chat Completions API 上,而 Astra 和 Claude 模型使用 Converse API。Claude Opus 5.5 也已提供。
在 provider 目录 浏览完整阵容和当前定价。
中文定价与更清晰的企业联系方式
定价页面的正文现在提供中文,方便团队用母语阅读完整的套餐说明。企业版的「Talk to Us」按钮现在会打开 联系页面,而不是邮件链接。
Token 计算器改进
token 计算器 现在会说明其估算的推导方式(针对英文 GPT 和 Claude 模型,每 4 个字符约等于 1 个 token 的经验规则),提示成本对比假定输入和输出相等并按标准按需价格计算,并说明你的文本完全在浏览器中计数。我们还新增了一个「这个估算近似哪些模型?」的常见问题。
本月其他更新
我们移除了旧版引导式 walkthrough,精简了 console。
