结果存疑
存疑:推理题部分通过,但证据还不足以给出高可信结论;最高可用模型 gpt-5.6-terra;最高程度 GPT-5.6 或更高;最高程度达到 GPT-5.5 标杆,未发现明显模型降级信号。;证据分 86/100;模型列表包含目标模型 gpt-5.6-terra;动态推理题请求失败:Upstream authentication failed, please contact administrator;指令遵循题通过:验证码和倒序字段匹配;上下文暗号题通过:长上下文暗号匹配,本地校验值通过;多条件逻辑题通过:多条件逻辑结果匹配;结构化转换题通过:结构化转换结果匹配;抗干扰指令题通过:抗干扰指令结果匹配;协议与元数据:包含响应 id,返回 model=gpt-5.6-terra,返回模型名与目标模型接近,finish_reason=stop,choices 内容可读,包含 token usage;最高程度:GPT-5.6 或更高;标杆:GPT-5.5;最高程度达到 GPT-5.5 标杆,未发现明显模型降级信号。;后台已按模型列表从高到低实际试测,采用首个可联通且专项测试通过的模型。
本次未形成通过结论。请核对服务商页面宣传、模型列表返回、Key 权限范围和实际扣费记录后再判断。
本报告基于一次真实探针生成
检测说明:本报告基于本次请求和接口返回生成,只对本次测试的数据负责;它不代表该接口在其它时间、账号额度或网络环境下保持相同表现。API Key 仅在受保护的管理后台留存,不在公共页面展示。
RESULT SNAPSHOT
检测结果
KEY METRICS
关键指标
MODEL LIST SIGNAL
模型列表信号
本次未形成通过结论。请核对服务商页面宣传、模型列表返回、Key 权限范围和实际扣费记录后再判断。
PASS / WARN / FAIL
逐项检查
| 检测项 | 状态 | HTTP | 耗时 | 证据分 | 说明 |
|---|---|---|---|---|---|
| 01高到低模型试测 | PASS | HTTP 200 | 61ms | 0 | 从模型列表识别到 12 个 GPT / OpenAI 系列 候选,按层级从高到低最多试测 6 个,结果采用首个可联通且专项测试通过的模型。 |
| 02候选模型未通过 | FAIL | 无响应 | 0ms | 0 | 候选模型 gpt-5.6 未作为结果:专项题通过 0/6,未达到基本可用线。继续尝试下一候选。 |
| 03候选模型未通过 | FAIL | 无响应 | 0ms | 0 | 候选模型 gpt-5.6-luna 未作为结果:专项题通过 0/6,未达到基本可用线。继续尝试下一候选。 |
| 04候选模型未通过 | FAIL | 无响应 | 0ms | 0 | 候选模型 gpt-5.6-sol 未作为结果:专项题通过 0/6,未达到基本可用线。继续尝试下一候选。 |
| 05候选模型通过 | PASS | 无响应 | 0ms | 0 | 候选模型 gpt-5.6-terra 可联通且专项测试通过,采用为本次检测结果。 |
| 06GET /v1/models | PASS | HTTP 200 | 50ms | 16 | 模型列表包含目标模型 gpt-5.6-terra |
| 07动态推理题 | FAIL | HTTP 502 | 4962ms | 0 | 动态推理题请求失败:Upstream authentication failed, please contact administrator |
| 08指令遵循题 | PASS | HTTP 200 | 3489ms | 14 | 指令遵循题通过:验证码和倒序字段匹配 |
| 09上下文暗号题 | PASS | HTTP 200 | 1634ms | 14 | 上下文暗号题通过:长上下文暗号匹配,本地校验值通过 |
| 10reasoning_logic | PASS | HTTP 200 | 2162ms | 14 | 多条件逻辑题通过:多条件逻辑结果匹配 |
| 11reasoning_transform | PASS | HTTP 200 | 1966ms | 14 | 结构化转换题通过:结构化转换结果匹配 |
| 12reasoning_guardrail | PASS | HTTP 200 | 3101ms | 14 | 抗干扰指令题通过:抗干扰指令结果匹配 |
| 13Chat协议与元数据 | PASS | HTTP 200 | 0ms | 20 | 协议与元数据:包含响应 id,返回 model=gpt-5.6-terra,返回模型名与目标模型接近,finish_reason=stop,choices 内容可读,包含 token usage |
| 14模型层级评分 | PASS | 无响应 | 0ms | 100 | 最高程度:GPT-5.6 或更高;标杆:GPT-5.5;最高程度达到 GPT-5.5 标杆,未发现明显模型降级信号。 |
SYNC
暂未收录本站
本次报告可直接分享给站长。若该站点希望进入评测列表,可提交公开资料和可核验信息。
提醒站长申请收录SAVE & REVIEW
保存与复核
报告保存哪些内容?
保存 Base URL、检测编号、模型列表摘要、返回模型、协议检查、自动评分和本次 API Key。API Key 仅限受保护的管理后台查看,不在报告或其它公共页面展示。
如何判断这份结果?
通过代表本次请求形成了较一致的证据;疑似降智代表最高可用模型低于标杆;无法联通代表本次没有拿到有效接口响应。