结果存疑
存疑:推理题部分通过,但证据还不足以给出高可信结论;最高可用模型 deepseek-v4.1-flash;最高程度 DeepSeek;最高程度识别为 DeepSeek。该类别暂按模型列表和动态题综合判断,建议结合服务商宣传模型名称复核是否存在降级。;证据分 86/100;模型列表包含目标模型 deepseek-v4.1-flash;动态推理题通过:答案匹配 440;指令遵循题通过:验证码和倒序字段匹配;上下文暗号题通过:长上下文暗号匹配,本地校验值通过;多条件逻辑题未通过:逻辑题不匹配,期望 bravo/13;结构化转换题通过:结构化转换结果匹配;抗干扰指令题通过:抗干扰指令结果匹配;协议与元数据:包含响应 id,返回 model=deepseek-v4.1-flash,返回模型名与目标模型接近,finish_reason=stop,choices 内容可读,包含 token usage;最高程度:DeepSeek;标杆:DeepSeek 系列;最高程度识别为 DeepSeek。该类别暂按模型列表和动态题综合判断,建议结合服务商宣传模型名称复核是否存在降级。;后台已按模型列表从高到低实际试测,采用首个可联通且专项测试通过的模型。
本次未形成通过结论。请核对服务商页面宣传、模型列表返回、Key 权限范围和实际扣费记录后再判断。
本报告基于一次真实探针生成
检测说明:本报告基于本次请求和接口返回生成,只对本次测试的数据负责;它不代表该接口在其它时间、账号额度或网络环境下保持相同表现。API Key 仅在受保护的管理后台留存,不在公共页面展示。
RESULT SNAPSHOT
检测结果
KEY METRICS
关键指标
MODEL LIST SIGNAL
模型列表信号
本次未形成通过结论。请核对服务商页面宣传、模型列表返回、Key 权限范围和实际扣费记录后再判断。
PASS / WARN / FAIL
逐项检查
| 检测项 | 状态 | HTTP | 耗时 | 证据分 | 说明 |
|---|---|---|---|---|---|
| 01高到低模型试测 | PASS | HTTP 200 | 270ms | 0 | 从模型列表识别到 3 个 DeepSeek 系列 候选,按层级从高到低最多试测 3 个,结果采用首个可联通且专项测试通过的模型。 |
| 02候选模型通过 | PASS | 无响应 | 0ms | 0 | 候选模型 deepseek-v4.1-flash 可联通且专项测试通过,采用为本次检测结果。 |
| 03GET /v1/models | PASS | HTTP 200 | 221ms | 16 | 模型列表包含目标模型 deepseek-v4.1-flash |
| 04动态推理题 | PASS | HTTP 200 | 1503ms | 14 | 动态推理题通过:答案匹配 440 |
| 05指令遵循题 | PASS | HTTP 200 | 1192ms | 14 | 指令遵循题通过:验证码和倒序字段匹配 |
| 06上下文暗号题 | PASS | HTTP 200 | 1547ms | 14 | 上下文暗号题通过:长上下文暗号匹配,本地校验值通过 |
| 07reasoning_logic | FAIL | HTTP 200 | 1381ms | 0 | 多条件逻辑题未通过:逻辑题不匹配,期望 bravo/13 |
| 08reasoning_transform | PASS | HTTP 200 | 1626ms | 14 | 结构化转换题通过:结构化转换结果匹配 |
| 09reasoning_guardrail | PASS | HTTP 200 | 1768ms | 14 | 抗干扰指令题通过:抗干扰指令结果匹配 |
| 10Chat协议与元数据 | PASS | HTTP 200 | 0ms | 20 | 协议与元数据:包含响应 id,返回 model=deepseek-v4.1-flash,返回模型名与目标模型接近,finish_reason=stop,choices 内容可读,包含 token usage |
| 11模型层级评分 | PASS | 无响应 | 0ms | 100 | 最高程度:DeepSeek;标杆:DeepSeek 系列;最高程度识别为 DeepSeek。该类别暂按模型列表和动态题综合判断,建议结合服务商宣传模型名称复核是否存在降级。 |
SYNC
暂未收录本站
本次报告可直接分享给站长。若该站点希望进入评测列表,可提交公开资料和可核验信息。
提醒站长申请收录SAVE & REVIEW
保存与复核
报告保存哪些内容?
保存 Base URL、检测编号、模型列表摘要、返回模型、协议检查、自动评分和本次 API Key。API Key 仅限受保护的管理后台查看,不在报告或其它公共页面展示。
如何判断这份结果?
通过代表本次请求形成了较一致的证据;疑似降智代表最高可用模型低于标杆;无法联通代表本次没有拿到有效接口响应。