不替换模型与自检方法

GPT API 掺水检测:怎么自己查中转站有没有换模型、降智

GPT.COM.SE 是第三方 GPT API 服务,非 OpenAI 官方。我们承诺不做模型替换,也把检查方法写在这里:下面 4 种方法对任何第三方 GPT 接口都适用,包括本站,每种都写清怎么做、能说明什么、局限在哪。

更新于

GPT.COM.SE 是第三方 GPT API 服务,非 OpenAI 官方,不做模型替换、缺货直接报错、按 OpenAI 官方美元价扣费、控制台逐条记录明细;检测中转站是否掺水,看返回的 model 字段、用 usage 核对扣费、用有标准答案的题固定对比,模型自报型号不能当证据。

本站的四条原则:不替换、缺货报错、官方价、明细可查

本站在模型和计费上守四条原则:不替换模型、缺货直接报错、按 OpenAI 官方美元价扣费、每次调用在控制台留明细。每一条都能用下文的方法自己核对。

原则具体做法你可以怎么核对
不做模型替换请求哪个模型就调用哪个模型,不偷偷换成更便宜的模型看返回的 model 字段(方法一),用固定题对比(方法三)
缺货直接报错某个模型暂时调不通时直接返回错误,不拿别的模型顶上报错说明请求没有被换走;换一个在售模型或稍后重试
按官方价扣费按 OpenAI 官方美元标价扣站内额度,分组倍率 1,充值 1 元得 1 美元额度用返回的 usage 和官方单价算一遍(方法二),对照 GPT API 价格
控制台明细每次调用都记录模型、token 数、费用逐条和返回里的 model、usage 对照

掺水是用户对这几类做法的统称:把你请求的模型换成更便宜的模型、多记 token 多扣钱、悄悄压低推理强度或截短上下文。降智是使用者的感受,指同一个模型回答质量明显变差,原因可能是掺水,也可能是自己这边的参数和工具设置,排查方法见下文的降智排查表。

本站只提供 GPT 系列模型,不提供 Claude、Gemini、Grok。在售模型和价格见 全部 GPT 模型与选型。

中转站掺水检测有哪几种方法:4 种方法一览

能自己做的检查有 4 种,前两种查「名字和账单对不对」,第三种查「能力对不对」,第四种常见但不可靠。把前三种组合起来用,结论才站得住。

方法怎么做能说明什么局限
一、看返回的 model 字段用 curl 或代码直接调接口,读返回 JSON 里的 model服务端声明这次用的是哪个模型;对不上就是明确的危险信号字段由服务端写,对得上也证明不了真实模型
二、核对 usage 和控制台扣费记下返回的 usage token 数,按官方单价算金额,和控制台明细、余额变化对照计费是否按官方价、有没有多记 tokenusage 也由服务端给出,查的是账,查不了模型身份
三、用有标准答案的题固定对比准备 10 到 20 道答案唯一的题,固定参数,每题跑 3 次,记正确率模型能力和同名模型是否一致,最接近「是不是真模型」有随机性,要有可信基准做对照,要花一些额度
四、让模型自报型号问「你是什么模型」基本说明不了什么模型常常不知道自己的版本名,系统提示也能让任何模型自称 GPT-6 Astra

方法一:看返回里的 model 字段

最快的检查是直接调一次接口,看返回 JSON 里的 model 字段是不是你请求的模型。model 字段是接口返回里标明「这次由哪个模型回答」的那一项。

怎么做

用 curl 调一次对话接口(Key 用「OpenAI」分组的,Base URL 就是接口地址的开头部分,这里是 https://gpt.com.se/v1)。下面的示例请求的是 gpt-5.6-sol,要检查别的模型就把 model 换掉,例如 gpt-6-astra:

curl https://gpt.com.se/v1/chat/completions \
  -H "Authorization: Bearer sk-你的Key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-sol",
    "messages": [{"role": "user", "content": "你好"}]
  }'

返回是一段 JSON,找到 "model" 这一项。写程序的话,在下面这段代码的末尾加两行打印:

from openai import OpenAI

client = OpenAI(
    api_key="sk-你的Key",
    base_url="https://gpt.com.se/v1",
)
resp = client.chat.completions.create(
    model="gpt-5.6-sol",          # 也可填 gpt-6-astra
    messages=[{"role": "user", "content": "用一句话介绍你自己"}],
)
print(resp.choices[0].message.content)
print(resp.model)   # 实际返回的模型名
print(resp.usage)   # prompt_tokens、completion_tokens 等用量

能说明什么

  • 返回的 model 和你请求的模型名一致,或是同一模型带日期后缀的正式版本名,属于正常。
  • 请求 gpt-6-astra,返回的却是另一个模型名(例如更便宜的小模型),这就是明确的替换信号,可以直接截图留证。

局限

  • model 字段是服务端写进去的,不诚实的服务可以照抄你请求的名字。所以对不上一定有问题,对得上不能算证明,要配合方法三。
  • 编程工具和聊天客户端通常不显示原始返回,流式输出(一个字一个字往外吐)时也不方便看全,检查时直接用 curl 或代码。

方法二:核对 usage token 和控制台扣费

对账的做法是:用返回里的 usage 按官方单价算出应扣金额,再和控制台明细、余额变化对照,三者应该一致。token 是模型计量文字的单位,输入和输出都按 token 数计费;usage 是返回里记录本次用了多少 token 的那一项。

要看的字段

字段(Chat Completions)字段(Responses API)含义按哪个单价算
usage.prompt_tokensusage.input_tokens输入 token 总数,包含命中缓存的部分未命中缓存的部分按输入价
usage.prompt_tokens_details.cached_tokensusage.input_tokens_details.cached_tokens输入里命中缓存的 token 数缓存读价,下表各模型都是输入价的十分之一
usage.completion_tokensusage.output_tokens输出 token 总数,包含推理 token输出价
usage.completion_tokens_details.reasoning_tokensusage.output_tokens_details.reasoning_tokens模型内部思考用掉的 token,你看不到文字,但按输出计费已含在输出 token 里,不要重复加

缓存读指短时间内重复发送的相同开头内容(例如同一段系统提示)命中了缓存,这部分按更低的单价收费。Codex 走的是 Responses API,看「字段(Responses API)」这一列。

算例:gpt-6-astra 一次调用该扣多少

假设返回里输入 100,000 token,其中命中缓存 60,000 token,输出 20,000 token(含推理 token)。按 gpt-6-astra 官方价 $10 / $1 / $50(每百万 token,输入 / 缓存读 / 输出)计算:

项目token 数官方单价(美元每百万 token)应扣美元额度本站实付(人民币)
未命中缓存的输入40,000$100.40 美元¥0.40
缓存读60,000$10.06 美元¥0.06
输出(含推理)20,000$501.00 美元¥1.00
合计120,0001.46 美元¥1.46
官方价来源:OpenAI 官方定价,核对日期 2026-09-30。本站分组倍率 1,扣的美元额度等于官方美元价算出的金额,充值 1 元得 1 美元额度,所以人民币实付数字和美元金额相同。实际扣费以控制台明细为准。

控制台这条明细的模型、token 数、费用应该和上表一致;调用前后余额的差也应该是 1.46 美元额度。要核对别的模型,把单价换成下表对应的一行:

模型输入(美元每百万 token)缓存读(美元每百万 token)输出(美元每百万 token)
gpt-6-astra$10$1$50
gpt-6-sol$2$0.2$10
gpt-5.6-sol$4$0.4$20
gpt-5.6-terra$2$0.2$12
gpt-5.6-luna$0.2$0.02$1.2
gpt-5.5$5$0.5$30
官方价来源:OpenAI 官方定价,核对日期 2026-09-30。gpt-5.6-sol 为官方限时价,官方说明至少到 2026-11-21;单次请求输入(含缓存读)超过 272K token 时,在售对话模型都按输入和缓存读 2 倍、输出 1.5 倍计价,核对这类长请求时要算进去。生图按张计费,每张 0.3 元。

能说明什么

  • 三者一致,说明计费按官方单价执行,没有加价、没有多记 token。
  • 同一段输入重复发送,prompt_tokens 应该基本不变;同样的内容这次比上次多出一截,要追问原因。

局限

  • usage 和控制台明细都来自服务端,对账只能证明「账是按声明的模型和官方价算的」,证明不了背后真是这个模型。
  • 推理 token 会让输出计费比你看到的文字多,这属于正常计费,先看 reasoning_tokens 再下结论。

方法三:用有标准答案的题固定对比

判断「是不是这个模型的真实能力」,最靠得住的办法是自己准备一套答案唯一的题,固定条件反复跑,看正确率。这是 4 种方法里唯一直接检查能力的办法。

怎么做

  1. 准备 10 到 20 道答案唯一、能自动判对错的题,题目要选小模型容易做错的。
  2. 固定条件:同样的题目文字、同一个模型名、同样的推理强度(reasoning_effort,控制模型想多深的参数),每次都开新对话。
  3. 每道题跑 3 次以上,记录正确率,同时记下每次返回的 model 和 usage。
  4. 找一个你信得过的基准做对照:同一个模型在你信任的渠道上的成绩,或者本站同一个模型过去的成绩。
  5. 同一套题再跑一个便宜的小模型(例如 gpt-5.6-luna),看它和你检查的模型能不能拉开差距。拉不开,说明题太简单,要换难题。

下面的脚本按上面的步骤跑题、打分,同时打印每次返回的模型名和 token 数(连接配置和 国内调用 GPT API 指南 里的一致):

from openai import OpenAI

client = OpenAI(
    api_key="sk-你的Key",
    base_url="https://gpt.com.se/v1",
)

MODEL = "gpt-6-astra"   # 要检查的模型
ROUNDS = 3              # 每道题跑几次
# 题目和标准答案自己准备 10 到 20 道,答案要唯一。下面两道只演示格式,实际要换成小模型容易做错的题
QUESTIONS = [
    ("17 × 23 等于多少?只回答数字。", "391"),
    ("单词 strawberry 里有几个字母 r?只回答数字。", "3"),
]

total_ok = 0
for q, ans in QUESTIONS:
    ok = 0
    for _ in range(ROUNDS):
        resp = client.chat.completions.create(
            model=MODEL,
            messages=[{"role": "user", "content": q}],
        )
        text = resp.choices[0].message.content.strip().rstrip("。.")  # 去掉结尾句号再判对错
        ok += int(text == ans)
        print(resp.model, resp.usage.prompt_tokens, resp.usage.completion_tokens, text)
    total_ok += ok
    print("答对 %d/%d:%s" % (ok, ROUNDS, q))
print("总正确率 %d/%d" % (total_ok, ROUNDS * len(QUESTIONS)))

题型参考

题型例子看什么
多步计算带单位换算的应用题,要求只回答最终数字大模型和小模型正确率的差距
代码题写一个函数,用你事先写好的单元测试判对错一次通过率
逻辑题条件多、答案唯一的推理题推理强度不同时正确率的变化
长上下文检索在一份很长的文档中间埋一句特定的话,最后提问这句话长输入后半段的内容还能不能答对,用来发现上下文被截短

上下文是模型一次能读进去的内容上限,gpt-6-astra 的上下文是 1.05M,约 105 万 token。长上下文测试不必塞满,输入 20 万 token 就能检查后半段有没有被截掉,在 gpt-6-astra 上只算输入约扣 2 美元额度。

能说明什么

正确率明显低于可信基准,或者和小模型拉不开差距,就是能力对不上的证据。这类证据比 model 字段和账单更接近真实情况。

局限

  • 模型输出有随机性,题少、次数少时偶然性很大,一两道题答错说明不了问题。
  • 必须有可信基准,否则只能看同一渠道前后是否稳定。
  • 推理强度、工具自动加的系统提示都会影响成绩,对比时条件要一样。
  • 要消耗额度,旗舰模型跑长上下文尤其要先估算费用。

方法四:为什么让模型自报型号不可靠

问模型「你是什么模型」得到的回答,既证明不了是真模型,也证明不了是假模型,不要拿它当证据。

怎么做

在对话里直接问「你是什么模型」「你的型号和版本是什么」。这是最常见的做法,也最容易误判。

能说明什么

几乎说明不了什么。真模型可能说错自己的名字,替换过的模型也可能报出你想听的名字。

局限

  • 模型对自己的认识来自训练数据:训练时新型号的名字往往还没出现,所以真模型也可能报一个旧名字,或者说自己是「GPT-4」之类。
  • 回答可以被系统提示控制:系统提示是请求里预先写给模型的说明,服务端或工具写一句「你是 GPT-6 Astra」,任何模型都会照着说。
  • 客户端也会加提示:不少编程工具和聊天客户端自带系统提示,模型的自我介绍会跟着变。

想确认型号,用方法一看 model 字段,再用方法三看能力。

gpt中转降智怎么排查:先查设置再下结论

觉得回答变差时,先排除自己这边的参数和工具设置,再用方法三的固定题确认。推理强度和上下文长度这两项设置直接影响回答质量,要先检查。

现象可能原因怎么查、怎么办
回答变短、推理变浅推理强度没传或调低了检查请求里的推理强度参数。Codex 在 ~/.codex/config.toml 里看 model_reasoning_effort = "high" 是否还在
在 Cursor 里明显不如命令行Cursor 的 BYOK 模式(自己填 API Key 使用)不会发送 reasoning_effort 参数,这是 Cursor 官方论坛报告的已知限制需要设置推理强度时改用 Codex,在 config.toml 里设 model_reasoning_effort;Cursor 的两条限制见 Cursor 接入 GPT API
Cursor 里切到别的 OpenAI 模型,本站控制台出现这条记录或请求报错Cursor 开启 Override OpenAI Base URL 后,所有 OpenAI 模型的请求都会走自定义地址,这也是 Cursor 官方论坛报告的已知限制只在要用本站模型时开启这个开关;想切回 Cursor 自带的 OpenAI 模型,先关掉 Override OpenAI Base URL
长对话后面忘了前面的内容工具为控制长度自动截掉了早期历史,或输入超过了上下文上限看返回的 prompt_tokens 是否和你实际发送的长度相符
同一道题时对时错模型输出本身有随机性每题跑 3 次以上看正确率,别凭一次下结论
请求直接报错、提示模型不可用该模型暂时缺货,本站直接报错,不会换成别的模型换一个在售模型,或稍后重试
返回的 model 和请求的对不上疑似被替换保存请求和返回,截图后通过反馈留言发给我们

5 步自检清单:本站和其他第三方 GPT 接口通用

按下面 5 步走一遍,就能对本站或任何第三方 GPT 接口有一个有依据的判断。

  1. 用 curl 调一次你要检查的模型,确认返回的 model 对得上(方法一)。
  2. 记下这次的 usage,按官方单价算应扣金额,和控制台明细、余额变化对照(方法二)。
  3. 先用 5 到 10 道有标准答案的难题各跑 3 次,记正确率,再用 gpt-5.6-luna 跑一遍做对照;要下结论时按方法三扩到 10 到 20 道。
  4. 觉得降智时,先按上面的排查表检查推理强度、工具设置和上下文长度。
  5. 不拿模型自报型号当证据(方法四)。

还没有 Key 的话,先 免费注册:新用户用纯数字 QQ 邮箱(例如 123456789@qq.com)注册送 5 美元体验额度,英文别名的 QQ 邮箱不送,活动仅限中国用户。可以先用体验额度跑一轮小规模检查;旗舰模型的推理 token 按输出价计费,题量大时先按方法二估算费用。

常见问题

怎么检测中转站是否掺水?

组合三种方法:看返回 JSON 里的 model 字段是否和请求一致,用 usage 按官方单价核对扣费,用有标准答案的题固定对比正确率。前两种查名字和账单,第三种查能力,只做一种不够。让模型自报型号不能当证据。

中转站掺水检测有百分百准确的方法吗?

没有单一方法能百分百确认。model 字段和 usage 都由服务端给出,只能发现明显的替换和多扣费;固定题对比最接近真实能力,但需要可信基准和足够的样本。几种方法结论一致时,判断才可靠。

gpt中转降智怎么解决?

先查自己这边:推理强度参数有没有传、工具有没有截短上下文、是不是用了 Cursor 的 BYOK 模式(不会发送 reasoning_effort)。排除设置问题后,再用固定题对比确认。确认是替换,就换一家按请求模型调用的服务。

gpt api 不降智的服务怎么选?

选承诺不做模型替换、缺货直接报错、按官方价扣费、控制台有逐条明细的服务,并且自己能按本页方法核对。本站按这四条执行,请求哪个模型就调用哪个模型。选之前可以用体验额度先跑一轮固定题。

gpt-6-astra 降智了吗,怎么判断?

判断要靠固定题对比,凭一两次回答下结论不准。准备一套答案唯一的难题,同样的推理强度下每题跑 3 次,和可信基准以及 gpt-5.6-luna 的成绩对比。在本站请求 gpt-6-astra 就调用 gpt-6-astra,缺货时直接报错。

问模型「你是什么模型」能判断有没有掺水吗?

不能。模型对自己型号的认识来自训练数据,真模型也常报旧名字;系统提示写一句「你是 GPT-6 Astra」,任何模型都会照着说。确认型号要看 model 字段,再用固定题查能力。

GPT.COM.SE 会替换模型吗?缺货怎么办?

不会。请求哪个模型就调用哪个模型,缺货时直接返回错误,不换成别的模型。遇到报错可以换一个在售模型或稍后重试。GPT.COM.SE 是第三方 API 服务,非 OpenAI 官方。

控制台扣费和返回的 token 数对不上怎么办?

先确认算法:输入里命中缓存的部分按缓存读价,输出 token 已经包含推理 token,单次输入超过 272K 时按长上下文价计价(输入和缓存读 2 倍、输出 1.5 倍)。按这个规则重算仍对不上,保存请求和返回,通过反馈留言发给我们。