开篇 · 一个看不见的陷阱

105 万 token 的窗口,
其实你「用不到」

GPT-6 Astra 号称有 1,050,000 token 的上下文窗口。但有两个独立的「天花板」,挡住了你真正用它。

天花板 1272K 的「价格悬崖」——输入一超线,整单翻倍计价
天花板 2速率限制——多数账号连一次「满窗口调用」都发不出去

把这两个天花板都搞对,同样的工作能省到原来的三分之一。

这篇文章讲的就是:怎么避开这两个坑,用「最低成本」拿到「最高质量」。

第 1 课 · 天花板一

272K 价格悬崖:超一点,整单翻倍

模型页面写着:prompt 超过 272,000 输入 token,价格就翻倍——输入和缓存价 2 倍、输出价 1.5 倍。

⚠️ 关键:不是「超出的部分」翻倍,是「整个请求」翻倍

一个 30k 的回答,从 $1.50 涨到 $2.25——只因为你的输入跨过了一条你从没看见的线。

👆 点我看「为什么这么狠」

🎯 判断:下面哪句话是对的?

「我输入 280K,只超出 8K,应该只多付 8K 的钱」

对。原文原话:「Not for the overage. For everything.」不是超出部分,是全部。
第 2 课 · 天花板二

你的 tier,连「满窗口」都发不出去

第二个坑在「速率限制表」里。每分钟 token 数(TPM),按用量层级分:

Tier 1500,000 / 分钟
Tier 21,000,000 / 分钟
Tier 32,000,000 / 分钟
Tier 44,000,000 / 分钟
Tier 540,000,000 / 分钟

窗口是 1,050,000 token。猜猜哪个 tier 才能「一次装满」?

哪个 tier 第一次让「满窗口单次调用」物理上装得下?

对。Tier 1 和 Tier 2 的单次满窗口请求会超过你的整分钟额度。Tier 3 是第一个「宣传的窗口物理上装进一次调用」的层级。
👆 点我看「你的真实天花板」
第 3 课 · effort 有五档

努力程度不是 3 档,是 5 档

reasoning.effort 接受 low / medium / high / xhigh / max 五档。

🎯 一个关键的「脚注」

发布评测里藏着一行脚注:除非特别说明,模型都是在「最大努力(max)」下跑的。

👆 点我看「这意味着什么」

🎯 判断:下面哪种用法最省钱又不掉质量?

一个日常任务,你该怎么设 effort?

对。评测的 max 是「采购决策」,不是「默认值」。别把 benchmark 的努力档照抄进生产。
第 4 课 · 两个成本杠杆

apply patch 和 tool search,直接改你的账单

Responses API 里有一堆工具。其中两个,直接影响你的账单:

1
apply patch整文件重写按「输出 $50/百万」计费。同样的编辑用结构化 diff,只是它的零头。这是输出侧最大的一笔节省。
2
tool search工具定义活在前缀里、每次调用都发送。超过约十几个工具后,按需加载能把这些从每请求账单里彻底拿掉。

🎯 判断:

Agent 每次改文件都整文件重写,账单会怎样?

对。整文件重写 = 输出 token 全价。apply patch 用结构化 diff,每次改动省一大笔——这是「输出侧最大的节省」。

你装了 30 个工具,但每个会话只用 3 个

对。超过约十几个工具后,按需加载能让它们不占每请求账单。
第 5 课 · 三档价格

Batch/Flex 半价,Fast 翻倍

Batch / Flex= 标准价的 50%。任何「没有人在等」的活都该放这里
Fast= 2 倍。你买的是延迟,不是质量

Batch 队列限制和 TPM 是分开的、而且大得多。比如 Tier 3 只有 2M TPM,但 batch 队列有 1 亿——所以「延后的活」永远不会和「实时流量」抢。

👆 点我看「省钱姿势」
第 6 课 · 常见错误 & 上手

四个常见错误 + 10 分钟 setup

❌ 四个常见错误

1
围绕「满窗口」做规划文档写 1.05M,实际 272K 就重定价,Tier 3 以下一次都发不满。
2
把评测的 effort 照抄进生产评测是 max 跑的,那是「采购决策」,不是「默认值」。
3
让 Agent 整文件重写输出 $50/百万,apply patch 就是为此而生的。
4
假设缓存「自动」就工作它是自动的,所以失败也不报错。cache_hit_rate 是唯一的证据。

⚡ 10 分钟 setup(5 步)

1
把 price() 贴进日志层(3 分钟)
2
每次调用前跑 preflight()带你的 tier 的 TPM(2 分钟)
3
reasoning.effort 设 low 做基线(1 分钟)
4
编辑文件都开 apply patch(2 分钟)
5
跑一次真实会话,读那个 dict(2 分钟)
👆 点我看「怎么算调好了」
结业 · 测一测

你真的懂了吗?

Q1. 272K「价格悬崖」的意思是?

对。不是超出的部分,是全部。输出也在同一请求里被重新计价。

Q2. 你的「真实上下文天花板」是?

对。「三个数字,最小的那个才是你的真实天花板。」

Q3. 评测里模型跑的是什么 effort?

对。发布评测默认 max(最慢最贵)。那是采购决策,不是默认值。

Q4. 怎么判断缓存「到底有没有在工作」?

对。缓存自动 + 前缀式 = 静默失败。cache_hit_rate 是唯一证据。
恭喜
🎓

你抓住了这篇文章的核心

百万 token 窗口,读起来像是「可以不用再考虑检索架构了」。
但价格在 272K 翻倍、速率限制在多数账号上更早卡住你——所以那个架构问题,从来都不是可选项。

一句话带走的 5 个结论

1️⃣ 两个天花板:272K 价格悬崖 + tier 的 TPM,取最小。

2️⃣ 超 272K,整单(含输出)翻倍计价。

3️⃣ effort 五档,默认 low 基线,别照抄评测的 max。

4️⃣ apply patch 省输出、tool search 省输入。

5️⃣ 没人等的活走 Batch(半价),别用 Fast 买不存在的质量。

原文:《The GPT-6 Astra Setup Guide》by darkzodchi(@zodchiii)

本页为互动教学演示,基于 darkzodchi (@zodchiii) 的原文 提炼整理,仅供学习。