结果存疑
存疑:有部分可用响应,但推理题或协议元数据不足;最高可用模型 gpt-5.6-sol;最高程度 GPT-5.6 或更高;最高程度达到 GPT-5.5 标杆,未发现明显模型降级信号。;证据分 58/100;模型列表包含目标模型 gpt-5.6-sol;动态推理题请求失败:This operation was aborted;指令遵循题通过:验证码和倒序字段匹配;上下文暗号题请求失败:This operation was aborted;多条件逻辑题请求失败:This operation was aborted;结构化转换题通过:结构化转换结果匹配;抗干扰指令题通过:抗干扰指令结果匹配;协议与元数据:包含响应 id,返回 model=gpt-5.6-sol,返回模型名与目标模型接近,finish_reason=stop,choices 内容可读,包含 token usage;最高程度:GPT-5.6 或更高;标杆:GPT-5.5;最高程度达到 GPT-5.5 标杆,未发现明显模型降级信号。;后台已按模型列表从高到低实际试测,采用首个可联通且专项测试通过的模型。
本次未形成通过结论。请核对服务商页面宣传、模型列表返回、Key 权限范围和实际扣费记录后再判断。
本报告基于一次真实探针生成
检测说明:本报告基于本次请求和接口返回生成,只对本次测试的数据负责;它不代表该接口在其它时间、账号额度或网络环境下保持相同表现。API Key 仅在受保护的管理后台留存,不在公共页面展示。
RESULT SNAPSHOT
检测结果
KEY METRICS
关键指标
MODEL LIST SIGNAL
模型列表信号
本次未形成通过结论。请核对服务商页面宣传、模型列表返回、Key 权限范围和实际扣费记录后再判断。
PASS / WARN / FAIL
逐项检查
| 检测项 | 状态 | HTTP | 耗时 | 证据分 | 说明 |
|---|---|---|---|---|---|
| 01高到低模型试测 | PASS | HTTP 200 | 103ms | 0 | 从模型列表识别到 7 个 GPT / OpenAI 系列 候选,按层级从高到低最多试测 6 个,结果采用首个可联通且专项测试通过的模型。 |
| 02候选模型未通过 | FAIL | 无响应 | 0ms | 0 | 候选模型 gpt-5.6-luna 未作为结果:专项题通过 0/6,未达到基本可用线。继续尝试下一候选。 |
| 03候选模型通过 | PASS | 无响应 | 0ms | 0 | 候选模型 gpt-5.6-sol 可联通且专项测试通过,采用为本次检测结果。 |
| 04GET /v1/models | PASS | HTTP 200 | 93ms | 16 | 模型列表包含目标模型 gpt-5.6-sol |
| 05动态推理题 | FAIL | 无响应 | 20001ms | 0 | 动态推理题请求失败:This operation was aborted |
| 06指令遵循题 | PASS | HTTP 200 | 16795ms | 14 | 指令遵循题通过:验证码和倒序字段匹配 |
| 07上下文暗号题 | FAIL | 无响应 | 20001ms | 0 | 上下文暗号题请求失败:This operation was aborted |
| 08reasoning_logic | FAIL | 无响应 | 20001ms | 0 | 多条件逻辑题请求失败:This operation was aborted |
| 09reasoning_transform | PASS | HTTP 200 | 5723ms | 14 | 结构化转换题通过:结构化转换结果匹配 |
| 10reasoning_guardrail | PASS | HTTP 200 | 6114ms | 14 | 抗干扰指令题通过:抗干扰指令结果匹配 |
| 11Chat协议与元数据 | PASS | HTTP 200 | 0ms | 20 | 协议与元数据:包含响应 id,返回 model=gpt-5.6-sol,返回模型名与目标模型接近,finish_reason=stop,choices 内容可读,包含 token usage |
| 12模型层级评分 | PASS | 无响应 | 0ms | 100 | 最高程度:GPT-5.6 或更高;标杆:GPT-5.5;最高程度达到 GPT-5.5 标杆,未发现明显模型降级信号。 |
SYNC
暂未收录本站
本次报告可直接分享给站长。若该站点希望进入评测列表,可提交公开资料和可核验信息。
提醒站长申请收录SAVE & REVIEW
保存与复核
报告保存哪些内容?
保存 Base URL、检测编号、模型列表摘要、返回模型、协议检查、自动评分和本次 API Key。API Key 仅限受保护的管理后台查看,不在报告或其它公共页面展示。
如何判断这份结果?
通过代表本次请求形成了较一致的证据;疑似降智代表最高可用模型低于标杆;无法联通代表本次没有拿到有效接口响应。