Google AI Studio怎么用?从创建API密钥到调用Gemini生成结构化结果
本文从首次使用场景出发,介绍如何进入Google AI Studio、创建并管理Gemini API密钥,在测试区提交提示词并检查模型输出,同时演示如何把会议文本整理为JSON。文中还说明结构化输出、参数调试、密钥保护、额度、地区和计费等需
ARTICLE DETAIL
大模型API返回429时,先根据错误正文、错误代码、响应头和服务商控制台判断原因,再区分请求频率、并发、Token吞吐量与账户额度。本文介绍如何尊重Retry-After,使用有上限的指数退避和随机抖
样式 7 内容详情排版
大模型API返回HTTP 429,通常表示当前请求没有被服务端正常接受,但“请求过多”并不是唯一解释。不同服务商可能把请求频率、并发数、输入输出Token吞吐量、账户额度或配额状态归入429,因此不能看到状态码后直接无限重试。
排查时记录HTTP状态码、错误正文中的错误代码和消息、响应头、请求时间、模型标识以及本地生成的请求ID。优先查看服务商文档和控制台中的限流、用量、账单或配额页面,确认该请求使用的项目、组织和密钥是否对应正确账户。不要只根据客户端封装后的“限流”提示下结论。
如果响应包含Retry-After,应优先按其指示等待;如果正文明确提示余额、额度或配额不足,就应先处理账户配置或额度问题。余额不足不应一律当作短暂限流,也不能假设等待一段时间后必然恢复。
只对有证据表明可恢复的错误进行重试,并设置最大重试次数、总等待时间和请求超时。没有Retry-After时,可以采用指数退避:每次失败后逐步增加等待时间,并加入随机抖动,避免多个客户端在同一时刻再次冲击服务端。例如等待时间可按“基础等待时间乘以2的重试次数次方”计算,再叠加一个小范围随机值,同时设置单次和总时长上限。这里的具体数值应结合服务商限制和业务时效调整,固定等待时间不能保证成功。
重试前要区分请求是否具有副作用。对于生成文本这类通常可重新提交的请求,应使用稳定的业务请求ID,避免重试造成重复记录;涉及扣费、写入或其他外部操作时,应配合幂等键或先查询结果。若连续达到上限,应把任务标记为待处理或失败并告警,而不是继续循环。
批量处理文档时,不要让所有任务同时调用API。可将任务放入队列,由固定数量的工作进程消费;当429增加时动态降低并发,恢复一段时间后再谨慎提高。对每个模型或项目分别维护并发计数和速率控制,避免多个应用实例各自限流、整体却仍然超出服务商限制。
同时检查是否存在重复调用:客户端超时后未确认结果就立即重发、前端重复提交、消息队列重复投递,都可能放大请求量。缓存确定性结果、合并小请求、限制单次输入长度,并在进入队列前做去重,通常比盲目增加重试更有效。
最后,应把429排查结果与正常响应、超时、服务端错误区分记录。只有结合错误正文、响应头、控制台指标和本地调用日志,才能判断问题是流量突增、并发配置不当、Token吞吐量过高,还是账户配额已经耗尽。