GPT.COM.SE 是第三方 GPT API 服务,非 OpenAI 官方,不做模型替换、缺货直接报错、按 OpenAI 官方美元价扣费、控制台逐条记录明细;检测中转站是否掺水,看返回的 model 字段、用 usage 核对扣费、用有标准答案的题固定对比,模型自报型号不能当证据。
本站的四条原则:不替换、缺货报错、官方价、明细可查
本站在模型和计费上守四条原则:不替换模型、缺货直接报错、按 OpenAI 官方美元价扣费、每次调用在控制台留明细。每一条都能用下文的方法自己核对。
| 原则 | 具体做法 | 你可以怎么核对 |
|---|---|---|
| 不做模型替换 | 请求哪个模型就调用哪个模型,不偷偷换成更便宜的模型 | 看返回的 model 字段(方法一),用固定题对比(方法三) |
| 缺货直接报错 | 某个模型暂时调不通时直接返回错误,不拿别的模型顶上 | 报错说明请求没有被换走;换一个在售模型或稍后重试 |
| 按官方价扣费 | 按 OpenAI 官方美元标价扣站内额度,分组倍率 1,充值 1 元得 1 美元额度 | 用返回的 usage 和官方单价算一遍(方法二),对照 GPT API 价格 |
| 控制台明细 | 每次调用都记录模型、token 数、费用 | 逐条和返回里的 model、usage 对照 |
掺水是用户对这几类做法的统称:把你请求的模型换成更便宜的模型、多记 token 多扣钱、悄悄压低推理强度或截短上下文。降智是使用者的感受,指同一个模型回答质量明显变差,原因可能是掺水,也可能是自己这边的参数和工具设置,排查方法见下文的降智排查表。
中转站掺水检测有哪几种方法:4 种方法一览
能自己做的检查有 4 种,前两种查「名字和账单对不对」,第三种查「能力对不对」,第四种常见但不可靠。把前三种组合起来用,结论才站得住。
| 方法 | 怎么做 | 能说明什么 | 局限 |
|---|---|---|---|
| 一、看返回的 model 字段 | 用 curl 或代码直接调接口,读返回 JSON 里的 model | 服务端声明这次用的是哪个模型;对不上就是明确的危险信号 | 字段由服务端写,对得上也证明不了真实模型 |
| 二、核对 usage 和控制台扣费 | 记下返回的 usage token 数,按官方单价算金额,和控制台明细、余额变化对照 | 计费是否按官方价、有没有多记 token | usage 也由服务端给出,查的是账,查不了模型身份 |
| 三、用有标准答案的题固定对比 | 准备 10 到 20 道答案唯一的题,固定参数,每题跑 3 次,记正确率 | 模型能力和同名模型是否一致,最接近「是不是真模型」 | 有随机性,要有可信基准做对照,要花一些额度 |
| 四、让模型自报型号 | 问「你是什么模型」 | 基本说明不了什么 | 模型常常不知道自己的版本名,系统提示也能让任何模型自称 GPT-6 Astra |
方法一:看返回里的 model 字段
最快的检查是直接调一次接口,看返回 JSON 里的 model 字段是不是你请求的模型。model 字段是接口返回里标明「这次由哪个模型回答」的那一项。
怎么做
用 curl 调一次对话接口(Key 用「OpenAI」分组的,Base URL 就是接口地址的开头部分,这里是 https://gpt.com.se/v1)。下面的示例请求的是 gpt-5.6-sol,要检查别的模型就把 model 换掉,例如 gpt-6-astra:
curl https://gpt.com.se/v1/chat/completions \
-H "Authorization: Bearer sk-你的Key" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-sol",
"messages": [{"role": "user", "content": "你好"}]
}'返回是一段 JSON,找到 "model" 这一项。写程序的话,在下面这段代码的末尾加两行打印:
from openai import OpenAI
client = OpenAI(
api_key="sk-你的Key",
base_url="https://gpt.com.se/v1",
)
resp = client.chat.completions.create(
model="gpt-5.6-sol", # 也可填 gpt-6-astra
messages=[{"role": "user", "content": "用一句话介绍你自己"}],
)
print(resp.choices[0].message.content)print(resp.model) # 实际返回的模型名
print(resp.usage) # prompt_tokens、completion_tokens 等用量能说明什么
- 返回的
model和你请求的模型名一致,或是同一模型带日期后缀的正式版本名,属于正常。 - 请求
gpt-6-astra,返回的却是另一个模型名(例如更便宜的小模型),这就是明确的替换信号,可以直接截图留证。
局限
model字段是服务端写进去的,不诚实的服务可以照抄你请求的名字。所以对不上一定有问题,对得上不能算证明,要配合方法三。- 编程工具和聊天客户端通常不显示原始返回,流式输出(一个字一个字往外吐)时也不方便看全,检查时直接用 curl 或代码。
方法二:核对 usage token 和控制台扣费
对账的做法是:用返回里的 usage 按官方单价算出应扣金额,再和控制台明细、余额变化对照,三者应该一致。token 是模型计量文字的单位,输入和输出都按 token 数计费;usage 是返回里记录本次用了多少 token 的那一项。
要看的字段
| 字段(Chat Completions) | 字段(Responses API) | 含义 | 按哪个单价算 |
|---|---|---|---|
usage.prompt_tokens | usage.input_tokens | 输入 token 总数,包含命中缓存的部分 | 未命中缓存的部分按输入价 |
usage.prompt_tokens_details.cached_tokens | usage.input_tokens_details.cached_tokens | 输入里命中缓存的 token 数 | 缓存读价,下表各模型都是输入价的十分之一 |
usage.completion_tokens | usage.output_tokens | 输出 token 总数,包含推理 token | 输出价 |
usage.completion_tokens_details.reasoning_tokens | usage.output_tokens_details.reasoning_tokens | 模型内部思考用掉的 token,你看不到文字,但按输出计费 | 已含在输出 token 里,不要重复加 |
缓存读指短时间内重复发送的相同开头内容(例如同一段系统提示)命中了缓存,这部分按更低的单价收费。Codex 走的是 Responses API,看「字段(Responses API)」这一列。
算例:gpt-6-astra 一次调用该扣多少
假设返回里输入 100,000 token,其中命中缓存 60,000 token,输出 20,000 token(含推理 token)。按 gpt-6-astra 官方价 $10 / $1 / $50(每百万 token,输入 / 缓存读 / 输出)计算:
| 项目 | token 数 | 官方单价(美元每百万 token) | 应扣美元额度 | 本站实付(人民币) |
|---|---|---|---|---|
| 未命中缓存的输入 | 40,000 | $10 | 0.40 美元 | ¥0.40 |
| 缓存读 | 60,000 | $1 | 0.06 美元 | ¥0.06 |
| 输出(含推理) | 20,000 | $50 | 1.00 美元 | ¥1.00 |
| 合计 | 120,000 | 1.46 美元 | ¥1.46 |
控制台这条明细的模型、token 数、费用应该和上表一致;调用前后余额的差也应该是 1.46 美元额度。要核对别的模型,把单价换成下表对应的一行:
| 模型 | 输入(美元每百万 token) | 缓存读(美元每百万 token) | 输出(美元每百万 token) |
|---|---|---|---|
gpt-6-astra | $10 | $1 | $50 |
gpt-6-sol | $2 | $0.2 | $10 |
gpt-5.6-sol | $4 | $0.4 | $20 |
gpt-5.6-terra | $2 | $0.2 | $12 |
gpt-5.6-luna | $0.2 | $0.02 | $1.2 |
gpt-5.5 | $5 | $0.5 | $30 |
能说明什么
- 三者一致,说明计费按官方单价执行,没有加价、没有多记 token。
- 同一段输入重复发送,
prompt_tokens应该基本不变;同样的内容这次比上次多出一截,要追问原因。
局限
- usage 和控制台明细都来自服务端,对账只能证明「账是按声明的模型和官方价算的」,证明不了背后真是这个模型。
- 推理 token 会让输出计费比你看到的文字多,这属于正常计费,先看
reasoning_tokens再下结论。
方法三:用有标准答案的题固定对比
判断「是不是这个模型的真实能力」,最靠得住的办法是自己准备一套答案唯一的题,固定条件反复跑,看正确率。这是 4 种方法里唯一直接检查能力的办法。
怎么做
- 准备 10 到 20 道答案唯一、能自动判对错的题,题目要选小模型容易做错的。
- 固定条件:同样的题目文字、同一个模型名、同样的推理强度(reasoning_effort,控制模型想多深的参数),每次都开新对话。
- 每道题跑 3 次以上,记录正确率,同时记下每次返回的
model和usage。 - 找一个你信得过的基准做对照:同一个模型在你信任的渠道上的成绩,或者本站同一个模型过去的成绩。
- 同一套题再跑一个便宜的小模型(例如
gpt-5.6-luna),看它和你检查的模型能不能拉开差距。拉不开,说明题太简单,要换难题。
下面的脚本按上面的步骤跑题、打分,同时打印每次返回的模型名和 token 数(连接配置和 国内调用 GPT API 指南 里的一致):
from openai import OpenAI
client = OpenAI(
api_key="sk-你的Key",
base_url="https://gpt.com.se/v1",
)
MODEL = "gpt-6-astra" # 要检查的模型
ROUNDS = 3 # 每道题跑几次
# 题目和标准答案自己准备 10 到 20 道,答案要唯一。下面两道只演示格式,实际要换成小模型容易做错的题
QUESTIONS = [
("17 × 23 等于多少?只回答数字。", "391"),
("单词 strawberry 里有几个字母 r?只回答数字。", "3"),
]
total_ok = 0
for q, ans in QUESTIONS:
ok = 0
for _ in range(ROUNDS):
resp = client.chat.completions.create(
model=MODEL,
messages=[{"role": "user", "content": q}],
)
text = resp.choices[0].message.content.strip().rstrip("。.") # 去掉结尾句号再判对错
ok += int(text == ans)
print(resp.model, resp.usage.prompt_tokens, resp.usage.completion_tokens, text)
total_ok += ok
print("答对 %d/%d:%s" % (ok, ROUNDS, q))
print("总正确率 %d/%d" % (total_ok, ROUNDS * len(QUESTIONS)))题型参考
| 题型 | 例子 | 看什么 |
|---|---|---|
| 多步计算 | 带单位换算的应用题,要求只回答最终数字 | 大模型和小模型正确率的差距 |
| 代码题 | 写一个函数,用你事先写好的单元测试判对错 | 一次通过率 |
| 逻辑题 | 条件多、答案唯一的推理题 | 推理强度不同时正确率的变化 |
| 长上下文检索 | 在一份很长的文档中间埋一句特定的话,最后提问这句话 | 长输入后半段的内容还能不能答对,用来发现上下文被截短 |
上下文是模型一次能读进去的内容上限,gpt-6-astra 的上下文是 1.05M,约 105 万 token。长上下文测试不必塞满,输入 20 万 token 就能检查后半段有没有被截掉,在 gpt-6-astra 上只算输入约扣 2 美元额度。
能说明什么
正确率明显低于可信基准,或者和小模型拉不开差距,就是能力对不上的证据。这类证据比 model 字段和账单更接近真实情况。
局限
- 模型输出有随机性,题少、次数少时偶然性很大,一两道题答错说明不了问题。
- 必须有可信基准,否则只能看同一渠道前后是否稳定。
- 推理强度、工具自动加的系统提示都会影响成绩,对比时条件要一样。
- 要消耗额度,旗舰模型跑长上下文尤其要先估算费用。
方法四:为什么让模型自报型号不可靠
问模型「你是什么模型」得到的回答,既证明不了是真模型,也证明不了是假模型,不要拿它当证据。
怎么做
在对话里直接问「你是什么模型」「你的型号和版本是什么」。这是最常见的做法,也最容易误判。
能说明什么
几乎说明不了什么。真模型可能说错自己的名字,替换过的模型也可能报出你想听的名字。
局限
- 模型对自己的认识来自训练数据:训练时新型号的名字往往还没出现,所以真模型也可能报一个旧名字,或者说自己是「GPT-4」之类。
- 回答可以被系统提示控制:系统提示是请求里预先写给模型的说明,服务端或工具写一句「你是 GPT-6 Astra」,任何模型都会照着说。
- 客户端也会加提示:不少编程工具和聊天客户端自带系统提示,模型的自我介绍会跟着变。
想确认型号,用方法一看 model 字段,再用方法三看能力。
gpt中转降智怎么排查:先查设置再下结论
觉得回答变差时,先排除自己这边的参数和工具设置,再用方法三的固定题确认。推理强度和上下文长度这两项设置直接影响回答质量,要先检查。
| 现象 | 可能原因 | 怎么查、怎么办 |
|---|---|---|
| 回答变短、推理变浅 | 推理强度没传或调低了 | 检查请求里的推理强度参数。Codex 在 ~/.codex/config.toml 里看 model_reasoning_effort = "high" 是否还在 |
| 在 Cursor 里明显不如命令行 | Cursor 的 BYOK 模式(自己填 API Key 使用)不会发送 reasoning_effort 参数,这是 Cursor 官方论坛报告的已知限制 | 需要设置推理强度时改用 Codex,在 config.toml 里设 model_reasoning_effort;Cursor 的两条限制见 Cursor 接入 GPT API |
| Cursor 里切到别的 OpenAI 模型,本站控制台出现这条记录或请求报错 | Cursor 开启 Override OpenAI Base URL 后,所有 OpenAI 模型的请求都会走自定义地址,这也是 Cursor 官方论坛报告的已知限制 | 只在要用本站模型时开启这个开关;想切回 Cursor 自带的 OpenAI 模型,先关掉 Override OpenAI Base URL |
| 长对话后面忘了前面的内容 | 工具为控制长度自动截掉了早期历史,或输入超过了上下文上限 | 看返回的 prompt_tokens 是否和你实际发送的长度相符 |
| 同一道题时对时错 | 模型输出本身有随机性 | 每题跑 3 次以上看正确率,别凭一次下结论 |
| 请求直接报错、提示模型不可用 | 该模型暂时缺货,本站直接报错,不会换成别的模型 | 换一个在售模型,或稍后重试 |
| 返回的 model 和请求的对不上 | 疑似被替换 | 保存请求和返回,截图后通过反馈留言发给我们 |
5 步自检清单:本站和其他第三方 GPT 接口通用
按下面 5 步走一遍,就能对本站或任何第三方 GPT 接口有一个有依据的判断。
- 用 curl 调一次你要检查的模型,确认返回的
model对得上(方法一)。 - 记下这次的
usage,按官方单价算应扣金额,和控制台明细、余额变化对照(方法二)。 - 先用 5 到 10 道有标准答案的难题各跑 3 次,记正确率,再用
gpt-5.6-luna跑一遍做对照;要下结论时按方法三扩到 10 到 20 道。 - 觉得降智时,先按上面的排查表检查推理强度、工具设置和上下文长度。
- 不拿模型自报型号当证据(方法四)。
还没有 Key 的话,先 免费注册:新用户用纯数字 QQ 邮箱(例如 123456789@qq.com)注册送 5 美元体验额度,英文别名的 QQ 邮箱不送,活动仅限中国用户。可以先用体验额度跑一轮小规模检查;旗舰模型的推理 token 按输出价计费,题量大时先按方法二估算费用。
常见问题
怎么检测中转站是否掺水?
组合三种方法:看返回 JSON 里的 model 字段是否和请求一致,用 usage 按官方单价核对扣费,用有标准答案的题固定对比正确率。前两种查名字和账单,第三种查能力,只做一种不够。让模型自报型号不能当证据。
中转站掺水检测有百分百准确的方法吗?
没有单一方法能百分百确认。model 字段和 usage 都由服务端给出,只能发现明显的替换和多扣费;固定题对比最接近真实能力,但需要可信基准和足够的样本。几种方法结论一致时,判断才可靠。
gpt中转降智怎么解决?
先查自己这边:推理强度参数有没有传、工具有没有截短上下文、是不是用了 Cursor 的 BYOK 模式(不会发送 reasoning_effort)。排除设置问题后,再用固定题对比确认。确认是替换,就换一家按请求模型调用的服务。
gpt api 不降智的服务怎么选?
选承诺不做模型替换、缺货直接报错、按官方价扣费、控制台有逐条明细的服务,并且自己能按本页方法核对。本站按这四条执行,请求哪个模型就调用哪个模型。选之前可以用体验额度先跑一轮固定题。
gpt-6-astra 降智了吗,怎么判断?
判断要靠固定题对比,凭一两次回答下结论不准。准备一套答案唯一的难题,同样的推理强度下每题跑 3 次,和可信基准以及 gpt-5.6-luna 的成绩对比。在本站请求 gpt-6-astra 就调用 gpt-6-astra,缺货时直接报错。
问模型「你是什么模型」能判断有没有掺水吗?
不能。模型对自己型号的认识来自训练数据,真模型也常报旧名字;系统提示写一句「你是 GPT-6 Astra」,任何模型都会照着说。确认型号要看 model 字段,再用固定题查能力。
GPT.COM.SE 会替换模型吗?缺货怎么办?
不会。请求哪个模型就调用哪个模型,缺货时直接返回错误,不换成别的模型。遇到报错可以换一个在售模型或稍后重试。GPT.COM.SE 是第三方 API 服务,非 OpenAI 官方。
控制台扣费和返回的 token 数对不上怎么办?
先确认算法:输入里命中缓存的部分按缓存读价,输出 token 已经包含推理 token,单次输入超过 272K 时按长上下文价计价(输入和缓存读 2 倍、输出 1.5 倍)。按这个规则重算仍对不上,保存请求和返回,通过反馈留言发给我们。