自己写 side project、做小工具、跑自动化脚本的独立开发者,一个月 API 预算通常就几十到几百块。真正的问题不是"用不起",而是钱花得莫名其妙:明明只是做意图分类,却调了旗舰模型;明明能缓存的结果,每次请求都重新算一遍。下面讲三件事——怎么选模型、怎么少烧 token、怎么把额度管住。
一、按任务分层选模型
分类、抽取、格式化输出这类活儿,小模型完全够用。GPT-4o mini、Gemini Flash、DeepSeek-V3 这个档位,输入价格通常是旗舰模型的 1/10 到 1/50。只有涉及复杂推理、长链条代码生成,才值得上旗舰。做法很简单:写一个 router,先用便宜模型跑,输出解析失败或置信度低再升级重试。
价格随时在变,以官方 pricing 页为准,别信博客里的旧数字。
二、别为用不上的 token 付钱
三个最容易漏的点:
- max_tokens 不设,模型话痨到天荒地老。固定输出格式的任务,设 512 甚至 128 就够。
- 长 system prompt 每次都重发。把它压缩,或者用上下文缓存(Anthropic 的 prompt caching、DeepSeek 的 cache hit),命中后输入成本能降到十分之一。
- 批量任务走 Batch API,OpenAI、Anthropic 都给 50% 折扣,代价只是不要求实时返回。
三、额度管理
在代码层加一层 wrapper,每次调用记录 model、input_tokens、output_tokens 和估算花费,落到 sqlite 或 jsonl 里。跑一天就知道哪个功能在吃钱。再设一个硬上限:当天累计超过 N 元就抛异常,或者降级到最便宜的模型。
另外,所有可复现的调用都按 prompt hash 缓存到本地。调试时别反复打真实 API——开发阶段用 mock 或本地小模型顶上,一次改一个字符就重跑一遍全流程,那是最贵的开发方式。
一个真实场景的数据
每天 2000 次文本分类,每次输入 800 token、输出 50 token。用旗舰模型按 $2.5/M 输入、$10/M 输出算:输入 1.6M token ≈ $4,输出 100k token ≈ $1,一天 5 美元。换成 mini 档($0.15/$0.6),一天不到 0.3 美元,一个月差出 140 美元。再加上把 800 token 的 system prompt 换成缓存命中,输入成本再砍一半。同样的活儿,账单从三位数掉到个位数。
结尾
先分层选模型,再砍掉冗余 token,最后用代码把预算焊死——省下的不是小钱,是让你敢多跑几个实验的底气。
如果你也想试试一个Key调多个模型的方便,可以看看充站——¥50起步,额度永久有效,用支付宝/微信就能付款。