GPT-5.6 Terra (max)
- 命理依据
- 23
- 现实洞察
- 24
- 行动建议
- 24
- 中文表达
- 23
命理推导严谨,现实信号精准,建议具体克制,表达清晰有节奏,适配产品阅读;两轮总分相差 2 分。
查看完整运行数据 ↗Chinese Evaluation / Fortune Telling
同一份匿名 2026 年固定样本下,对 15 个有效模型输出进行四维 AI 盲评,比较命理依据、现实洞察、行动建议与中文表达。
NEW GPT RUN
同一固定样本、三个独立临时会话,统一使用 max 推理强度;内容继续进入全榜匿名双轮评分。
命理推导严谨,现实信号精准,建议具体克制,表达清晰有节奏,适配产品阅读;两轮总分相差 2 分。
查看完整运行数据 ↗命理逻辑连贯,现实信号具体,建议可执行,中文表达流畅有节奏,整体质量较高;两轮总分相差 1 分。
查看完整运行数据 ↗命理逻辑通顺,现实信号贴合,建议可落地,表达平实,稍欠节奏感;两轮总分相差 0 分。
查看完整运行数据 ↗调用通道:Codex CLI / ChatGPT OAuth。CLI 未提供 temperature 与 max_tokens 控制,因此两项均未设置;耗时只作本批次工程记录。
AI CONTENT SCORE
四项内容维度各 25 分,总分 100。切换维度后,榜单按对应分数重新排序;展开模型可查看原文证据和两轮分差。
命理逻辑连贯,现实信号具体,建议可执行,表达流畅有节奏,仅结尾稍显截断。
命理逻辑连贯,现实信号具体,建议可执行,表达流畅有节奏,仅少量冗余。
命理推导严谨,现实信号精准,建议具体克制,表达清晰有节奏,适配产品阅读。
命理逻辑连贯,现实信号具体,建议可执行,中文表达流畅有节奏,整体质量较高。
命理推导严谨,现实对应精准,建议明确克制,表达有节奏感。
命理依据充分,现实映射清晰,建议明确克制,表达自然,仅稍显模板化。
命理推导清晰,现实对应明确,建议较具体,但部分表述稍显模板化。
“丙午大运与丙午流年“岁运并临”,火势极旺,如同将全部燃料投入一个引擎”
两轮分差 3 分
查看该次完整输出 ↗命理逻辑清晰,现实信号具体,建议实用,表达自然,仅少量冗余。
命理逻辑通顺,现实信号较具体,建议可落地,表达稍模板化,整体合格。
命理逻辑连贯,现实信号具体,建议可执行,表达自然清晰,仅少量冗余。
命理逻辑连贯,现实信号具体,建议可执行,中文表达自然流畅,整体质量较好。
命理逻辑通顺,现实信号贴合,建议可落地,表达平实,稍欠节奏感。
命理逻辑基本连贯,现实信号较具体,建议可行,表达稍显模板化。
命理有自刑等合理推导,但建议含保健品等不当内容,现实信号稍空泛。
命理逻辑有断裂,现实信号不完整,建议缺失,内容截断,表达不完整。
ENGINEERING STATUS
格式问题不会改写 AI 内容分。4 个输出需要 JSON 修复或补齐字段;HY3、小米与 GPT 追加批次的延迟不参与跨批次比较。
| 排名 | 模型 | 内容分 | JSON | 字段 | 延迟 | 输出 | 原文 |
|---|---|---|---|---|---|---|---|
| 01 | GLM-5V-TurboTencentMaaS | 94 | 通过 | 完整 | 88.4 秒 | 2,400 Token | 查看 ↗ |
| 02 | DeepSeek-V4-FlashTencentMaaS | 94 | 通过 | 完整 | 21.5 秒 | 1,564 Token | 查看 ↗ |
| 03 | GPT-5.6 Terra (max)Codex CLI / ChatGPT OAuth | 94 | 通过 | 完整 | 122.0 秒* | 3,966 Token | 查看 ↗ |
| 04 | GPT-5.6 Sol (max)Codex CLI / ChatGPT OAuth | 93 | 通过 | 完整 | 130.9 秒* | 4,408 Token | 查看 ↗ |
| 05 | MiniMax-M2.5TencentMaaS | 92 | 通过 | 完整 | 27.2 秒 | 2,045 Token | 查看 ↗ |
| 06 | MiniMax-M2.7TencentMaaS | 92 | 需修复 | 不完整 | 85.8 秒 | 1,872 Token | 查看 ↗ |
| 07 | DeepSeek-V3.2TencentMaaS | 91 | 通过 | 完整 | 39.2 秒 | 1,309 Token | 查看 ↗ |
| 08 | DeepSeek-V4-ProTencentMaaS | 90 | 通过 | 完整 | 43.7 秒 | 1,616 Token | 查看 ↗ |
| 09 | Hy3 PreviewTencentMaaS | 90 | 通过 | 完整 | 43.7 秒 | 977 Token | 查看 ↗ |
| 10 | Xiaomi MiMo V2.5 ProXiaomi MiMo Token Plan | 90 | 通过 | 完整 | 61.8 秒* | 1,258 Token | 查看 ↗ |
| 11 | HY3CloudBase AI | 89 | 通过 | 完整 | 23.9 秒* | 869 Token | 查看 ↗ |
| 12 | GPT-5.6 Luna (max)Codex CLI / ChatGPT OAuth | 89 | 通过 | 完整 | 120.2 秒* | 3,919 Token | 查看 ↗ |
| 13 | GLM-5TencentMaaS | 84 | 需修复 | 不完整 | 42.5 秒 | 2,400 Token | 查看 ↗ |
| 14 | DeepSeek-V3.0324TencentMaaS | 71 | 需修复 | 不完整 | 27.0 秒 | 794 Token | 查看 ↗ |
| 15 | GLM-5.1TencentMaaS | 46 | 通过 | 不完整 | 52.1 秒 | 2,400 Token | 查看 ↗ |
* HY3 走 CloudBase AI 独立批次;Xiaomi MiMo V2.5 Pro 与三个 GPT 模型来自其他追加批次。它们的延迟只作记录。
JUDGING PROTOCOL
同一份匿名固定样本:事业与财富得分较高、健康得分较低,用于检验模型能否解释高机会与高风险并存的年度状态。
命理依据是否解释大运、流年、藏干、十神与岁运并临,而不是只堆术语
是否把事业、财富、关系与健康的强弱翻译成具体体感和现实信号
行动建议是否明确、克制、可执行,能够回应高机会与高风险并存的状态
中文是否自然、清晰、有节奏,适合面向用户的产品阅读
temperature 0.2
至少 2 轮独立评分
触发第三轮,按各维中位数聚合
2026-07-22
LIMITATIONS
它是固定样本上的内容质量复评,不是命理有效性证明,也不是通用中文能力排名。
这是单一匿名固定样本,不代表模型在所有命理任务上的平均水平。
内容得分由 AI Judge 在匿名、乱序条件下按专题 rubric 生成,只适用于本次固定样本,不是全站综合评分。
HY3、小米与 GPT 模型来自后续独立批次和不同 Provider 路径,因此延迟不宜跨批次直接排名。
GPT 三个模型通过 Codex CLI 独立临时会话生成,显式使用 max 推理强度;CLI 不提供 temperature、max_tokens 或独立 system-role 参数。
本专题评估中文产品输出质量与结构稳定性,不验证命理预测是否具有科学有效性;Judge 也可能存在模型偏好。
PROVENANCE
结构化镜像同时保留 15 个有效输出、AI Judge 逐轮分数和原始运行记录。