不怕贵,怕不透明。价签清楚的站,贵一点也能算账;价签模糊的站,便宜也可能吃亏。
| 维度 | 要看的硬指标 | 怎么验证 |
|---|---|---|
| 计费透明 | 返回体是否给出 cache hit / miss 拆分 | 发一个请求看 usage 字段 |
| 倍率公开 | 分组倍率是否写在后台 | 不是写在宣传页,是写在后台「可用渠道」 |
| 缓存单价 | 缓存读是否显著低于正常输入 | 常见 10%,15%~30% 要留神 |
| 协议覆盖 | 同一 base_url 是否同时支持 OpenAI + Anthropic | 分别打 /v1/chat/completions 和 /v1/messages |
| 账单颗粒度 | 能否按请求看 token、延迟、实际扣费 | 有没有明细导出 |
| 充值门槛 | 起充金额、余额是否过期 | 起充越低越安全 |
curl -s -o /dev/null -w "%{http_code}\n" https://你的中转站/v1/models
# 期望:401。返回 200 说明鉴权形同虚设;返回花哨错误页说明是套壳
curl -s https://你的中转站/v1/models -H "Authorization: Bearer $KEY" | head -c 800
# 关注响应里的这两个字段,没有就是黑盒计费: # prompt_cache_hit_tokens # prompt_cache_miss_tokens
这是最狠的验证项。缓存没生效,成本会差出 5~10 倍,而且账单上看不出来。把两次的 usage 和扣费金额对比,差额就是缓存真实生效的证据。
curl -s https://你的中转站/v1/messages \
-H "x-api-key: $KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"claude-sonnet-4-5","max_tokens":16,
"messages":[{"role":"user","content":"hi"}]}'
| 指标 | 数值 | 说明 |
|---|---|---|
| prompt_tokens | 1,755 | 总输入 |
| prompt_cache_hit_tokens | 1,536(87.5%) | 走缓存读 |
| prompt_cache_miss_tokens | 219 | 按正常输入计价 |
| completion_tokens | 20 | 输出 |
编程类 Agent(Claude Code、Codex CLI)每一轮都在重发大段系统提示和文件上下文。当输入里 80%+ 走缓存命中时,缓存单价就成了账单的主导项。
这就解释了为什么「标价低」和「实际便宜」经常是两回事:
下面是单账号累计数据(来自后台账单,非宣传口径):
| 指标 | 数值 |
|---|---|
| 累计请求 | 30,734 次 |
| 累计 Token | 40.7 亿 |
| 实付 | ¥28.67 |
| 平台标准价 | ¥359.51 |
| 实付比例 | 7.97% |
四端点全通(同一个 base_url):
| 端点 | 协议 | 结果 | 耗时 |
|---|---|---|---|
GET /v1/models | OpenAI | 200 | 1.61s |
POST /v1/chat/completions | OpenAI | 200 | 2.19s |
POST /v1/responses | OpenAI Responses | 200 | 2.37s |
POST /v1/messages | Anthropic | 200 | 3.94s |
不带 key 访问 /v1/models 返回 401。
模型名要跟实际能调的清单一致。先 curl /v1/models 拿到确切名字再填。
Codex CLI 要求带 /v1,Claude Code 要求不带 /v1。这是最常见的坑。
不能。key 是站点级别的,换站必须换 key。
Q:担心跑路怎么办?小额试。先充最低额度跑两周,够用再续。
上面第四节的数据就是它。一个 base URL 同时支持 OpenAI 三端点与 Anthropic Messages。
https://api.dshapi.icu/v1