GPT-6 Astra 号称有 1,050,000 token 的上下文窗口。但有两个独立的「天花板」,挡住了你真正用它。
把这两个天花板都搞对,同样的工作能省到原来的三分之一。
这篇文章讲的就是:怎么避开这两个坑,用「最低成本」拿到「最高质量」。
模型页面写着:prompt 超过 272,000 输入 token,价格就翻倍——输入和缓存价 2 倍、输出价 1.5 倍。
一个 30k 的回答,从 $1.50 涨到 $2.25——只因为你的输入跨过了一条你从没看见的线。
输出也会在同一个请求里被重新计价。
你本来只想「多塞一点上下文」,结果整个请求的输入、输出、缓存全都翻倍——就因为你越过了 272K 那条线。
「我输入 280K,只超出 8K,应该只多付 8K 的钱」
第二个坑在「速率限制表」里。每分钟 token 数(TPM),按用量层级分:
哪个 tier 第一次让「满窗口单次调用」物理上装得下?
reasoning.effort 接受 low / medium / high / xhigh / max 五档。
发布评测里藏着一行脚注:除非特别说明,模型都是在「最大努力(max)」下跑的。
那些炫目的分数——FrontierMath Tier 4 拿 98%、ARC-AGI-3 拿 99.9%、ExploitBench 拿 100%——全都是在最慢、最贵的 max 档跑的。
所以正确姿势是:默认用 low 做基线,需要的那一步升到 high,把 xhigh 和 max 留给「你自己本来会亲手做」的活。
一个日常任务,你该怎么设 effort?
Responses API 里有一堆工具。其中两个,直接影响你的账单:
Agent 每次改文件都整文件重写,账单会怎样?
你装了 30 个工具,但每个会话只用 3 个
Batch 队列限制和 TPM 是分开的、而且大得多。比如 Tier 3 只有 2M TPM,但 batch 队列有 1 亿——所以「延后的活」永远不会和「实时流量」抢。
给 price() 传 mode="batch",折扣就生效,日志会显示「同样的活,两种模式各花多少」。
记住:没有人在等的活 → Batch(半价)。有人等、要速度 → 才用 Fast(2 倍,买的是延迟不是质量)。
cache_hit_rate 是唯一的证据。如果 over_cliff = false,且 cache_hit_rate 一轮比一轮高——你就调好了。
如果哪个没过,你现在确切知道是哪一个、以及它花了你多少钱。
Q1. 272K「价格悬崖」的意思是?
Q2. 你的「真实上下文天花板」是?
Q3. 评测里模型跑的是什么 effort?
Q4. 怎么判断缓存「到底有没有在工作」?
百万 token 窗口,读起来像是「可以不用再考虑检索架构了」。
但价格在 272K 翻倍、速率限制在多数账号上更早卡住你——所以那个架构问题,从来都不是可选项。
1️⃣ 两个天花板:272K 价格悬崖 + tier 的 TPM,取最小。
2️⃣ 超 272K,整单(含输出)翻倍计价。
3️⃣ effort 五档,默认 low 基线,别照抄评测的 max。
4️⃣ apply patch 省输出、tool search 省输入。
5️⃣ 没人等的活走 Batch(半价),别用 Fast 买不存在的质量。
原文:《The GPT-6 Astra Setup Guide》by darkzodchi(@zodchiii)