这家公司在生产环境接入了 Claude Sonnet,做文档解析和文本生成,调用量在预期范围内。问题出在元数据匹配上——部分请求的模型标识没正确写入日志,计费系统按默认高单价模型计费,而不是实际调用的低价模型。这种 bug 不罕见,很多团队接入多模型时都会遇到元数据混乱。
更关键的是三道防线全空:没有预算护栏,账户没设硬性预算上限,云端后付费,调用不停账单就累计,直到季度审计才发现;没有调用限流,某个接口被误配成轮询,QPS 从 10 涨到 1000,或代码写错模型名所有请求都走到最贵那个,几分钟内把账单顶到天际;没有异常告警,月度账单波动被合理化成「用量上来了」,等有人认真看明细,超支已从几千滚到 180 万。
最贵的 API 调用,往往不是你规划里的那一次,而是某个没人盯着的异常循环。