用户问:
"今天上午 GLM-5.2 调用一堆 503,我们业务挂了,怎么办?"
直接说:这就需要您立刻做 3 件事。
第 1 步:确认是不是真的"上游"挂了
用 curl 简单测一下
curl -X POST https://open.bigmodel.cn/api/paas/v4/chat/completions
-H "Authorization: Bearer YOUR_KEY"
-d '{"model":"glm-5.2","messages":[{"role":"user","content":"ping"}]}'
✅ 返回正常 → 可能是您配置问题(超时设置、headers)
❌ 返回 503 → 上游确实挂了
如果您用了聚合平台(OpenRouter/OpenAI 兼容),也要测它。
第 2 步:立刻切到备用 如果您之前配置过多上游(希望是):
紧急切换
models = ["deepseek-v3", "claude-3-5", "kimi-k2"] for model in models: try: response = client.chat.completions.create( model=model, messages=messages, timeout=10 ) print(f"✅ 用 {model} 成功") # 临时改路由配置 primary_model = model break except Exception: continue 如果您没配过多上游(那这次是个教训): - 看您公司是否有其他 API Key(DeepSeek/Kimi/Claude) - 用任意一个顶上去
第 3 步:通知用户 + 记录 对外: - App 顶部弹一条"服务维护中,正在恢复" - 客服群通知客户
对内: - 记录事故时间、影响范围 - 联系上游客服(智谱 AI / OpenAI 等) - 估损:多少客户受影响、损失多少调用
长期解法(避免下次) 今天这件事告诉我们:
❌ 单上游 = 高风险 ✅ 至少 2 个供应商备份 ✅ 自动切换不要手动切 ✅ 监控告警比用户报问题早 ⚠️ 我必须坦诚 我没法告诉您具体什么时候 GLM-5.2 恢复。 - 这是上游智谱 AI 的事 - 您要问就去问他们(支持群里问) - 同时备好降级方案
完成后:复盘 事故恢复后,立刻做 3 件事:
写事故报告(给团队看) 加 1 个备用供应商 加 1 个健康检查脚本(每小时跑)
