Chinese Evaluation / Fortune Telling

命理年度详解模型横评

同一份匿名 2026 年固定样本下,对 15 个有效模型输出进行四维 AI 盲评,比较命理依据、现实洞察、行动建议与中文表达。

数据快照:2026-07-22查看 Kline-star 原始输出 ↗
有效输出15
固定样本1
AI Judgehy3-preview
匿名评分2+ 轮

NEW GPT RUN

GPT-5.6 三个 max 模型实测

同一固定样本、三个独立临时会话,统一使用 max 推理强度;内容继续进入全榜匿名双轮评分。

榜单序位 0394/ 100

GPT-5.6 Terra (max)

命理依据
23
现实洞察
24
行动建议
24
中文表达
23

命理推导严谨,现实信号精准,建议具体克制,表达清晰有节奏,适配产品阅读;两轮总分相差 2 分。

查看完整运行数据 ↗
榜单序位 0493/ 100

GPT-5.6 Sol (max)

命理依据
23
现实洞察
24
行动建议
23
中文表达
23

命理逻辑连贯,现实信号具体,建议可执行,中文表达流畅有节奏,整体质量较高;两轮总分相差 1 分。

查看完整运行数据 ↗
榜单序位 1289/ 100

GPT-5.6 Luna (max)

命理依据
22
现实洞察
22
行动建议
23
中文表达
22

命理逻辑通顺,现实信号贴合,建议可落地,表达平实,稍欠节奏感;两轮总分相差 0 分。

查看完整运行数据 ↗

调用通道:Codex CLI / ChatGPT OAuth。CLI 未提供 temperature 与 max_tokens 控制,因此两项均未设置;耗时只作本批次工程记录。

AI CONTENT SCORE

15 个有效输出完整排名

四项内容维度各 25 分,总分 100。切换维度后,榜单按对应分数重新排序;展开模型可查看原文证据和两轮分差。

15 / 15 个有效输出

综合得分四项内容维度之和 · 数值越高越好
满分 100
  1. 01
    GLM-5V-TurboTencentMaaS
    结构通过
    94/100

    命理逻辑连贯,现实信号具体,建议可执行,表达流畅有节奏,仅结尾稍显截断。

    查看四维得分与原文依据
    命理依据23/25
    现实洞察24/25
    行动建议24/25
    中文表达23/25
    丙午大运遇上丙午流年,岁运并临,能量叠加极为强烈

    两轮分差 4

    查看该次完整输出 ↗
  2. 02
    DeepSeek-V4-FlashTencentMaaS
    结构通过
    94/100

    命理逻辑连贯,现实信号具体,建议可执行,表达流畅有节奏,仅少量冗余。

    查看四维得分与原文依据
    命理依据23/25
    现实洞察24/25
    行动建议23/25
    中文表达24/25
    岁运并临,火势极旺,偏财星强力显现,事业财富迎冲高窗口

    两轮分差 1

    查看该次完整输出 ↗
  3. 03
    GPT-5.6 Terra (max)Codex CLI / ChatGPT OAuth
    结构通过
    94/100

    命理推导严谨,现实信号精准,建议具体克制,表达清晰有节奏,适配产品阅读。

    查看四维得分与原文依据
    命理依据23/25
    现实洞察24/25
    行动建议24/25
    中文表达23/25
    火势推你登高,真正的赢家是懂得止盈与收身的人。

    两轮分差 2

    查看该次完整输出 ↗
  4. 04
    GPT-5.6 Sol (max)Codex CLI / ChatGPT OAuth
    结构通过
    93/100

    命理逻辑连贯,现实信号具体,建议可执行,中文表达流畅有节奏,整体质量较高。

    查看四维得分与原文依据
    命理依据23/25
    现实洞察24/25
    行动建议23/25
    中文表达23/25
    丙午大运再逢丙午流年,岁运并临,意味着同一股力量被成倍放大

    两轮分差 1

    查看该次完整输出 ↗
  5. 05
    MiniMax-M2.5TencentMaaS
    结构通过
    92/100

    命理推导严谨,现实对应精准,建议明确克制,表达有节奏感。

    查看四维得分与原文依据
    命理依据23/25
    现实洞察24/25
    行动建议23/25
    中文表达22/25
    丙午大运本身已是一团烈火,流年丙午岁运并临,火势叠加到极致

    两轮分差 1

    查看该次完整输出 ↗
  6. 06
    MiniMax-M2.7TencentMaaS
    需工程修复
    92/100

    命理依据充分,现实映射清晰,建议明确克制,表达自然,仅稍显模板化。

    查看四维得分与原文依据
    命理依据24/25
    现实洞察23/25
    行动建议23/25
    中文表达22/25
    丙午大运遇上丙午流年,岁运并临,能量叠加极为强烈

    两轮分差 1

    查看该次完整输出 ↗
  7. 07
    DeepSeek-V3.2TencentMaaS
    结构通过
    91/100

    命理推导清晰,现实对应明确,建议较具体,但部分表述稍显模板化。

    查看四维得分与原文依据
    命理依据24/25
    现实洞察23/25
    行动建议22/25
    中文表达22/25
    丙午大运与丙午流年“岁运并临”,火势极旺,如同将全部燃料投入一个引擎

    两轮分差 3

    查看该次完整输出 ↗
  8. 08
    DeepSeek-V4-ProTencentMaaS
    结构通过
    90/100

    命理逻辑清晰,现实信号具体,建议实用,表达自然,仅少量冗余。

    查看四维得分与原文依据
    命理依据22/25
    现实洞察23/25
    行动建议22/25
    中文表达23/25
    岁运并临,物极必反,这股强大的火气也在剧烈消耗你的根基

    两轮分差 1

    查看该次完整输出 ↗
  9. 09
    Hy3 PreviewTencentMaaS
    结构通过
    90/100

    命理逻辑通顺,现实信号较具体,建议可落地,表达稍模板化,整体合格。

    查看四维得分与原文依据
    命理依据22/25
    现实洞察23/25
    行动建议23/25
    中文表达22/25
    岁运并临火气冲天,财富事业冲高,健康紧绷需守中持重。

    两轮分差 6

    查看该次完整输出 ↗
  10. 10
    Xiaomi MiMo V2.5 ProXiaomi MiMo Token Plan
    结构通过
    90/100

    命理逻辑连贯,现实信号具体,建议可执行,表达自然清晰,仅少量冗余。

    查看四维得分与原文依据
    命理依据22/25
    现实洞察23/25
    行动建议22/25
    中文表达23/25
    岁运并临,火势极旺,催动事业与财富运势冲上高点

    两轮分差 0

    查看该次完整输出 ↗
  11. 11
    HY3CloudBase AI
    结构通过
    89/100

    命理逻辑连贯,现实信号具体,建议可执行,中文表达自然流畅,整体质量较好。

    查看四维得分与原文依据
    命理依据22/25
    现实洞察23/25
    行动建议22/25
    中文表达22/25
    丙午岁运并临,财业冲高却身弱,这一年赚得到也要守得住命。

    两轮分差 1

    查看该次完整输出 ↗
  12. 12
    GPT-5.6 Luna (max)Codex CLI / ChatGPT OAuth
    结构通过
    89/100

    命理逻辑通顺,现实信号贴合,建议可落地,表达平实,稍欠节奏感。

    查看四维得分与原文依据
    命理依据22/25
    现实洞察22/25
    行动建议23/25
    中文表达22/25
    丙午大运遇丙午流年,属于岁运并临,主题不是平缓累积

    两轮分差 0

    查看该次完整输出 ↗
  13. 13
    GLM-5TencentMaaS
    需工程修复
    84/100

    命理逻辑基本连贯,现实信号较具体,建议可行,表达稍显模板化。

    查看四维得分与原文依据
    命理依据21/25
    现实洞察22/25
    行动建议21/25
    中文表达20/25
    丙午大运遇上丙午流年,命理谓之岁运并临,犹如引擎同时拉到最高档

    两轮分差 0

    查看该次完整输出 ↗
  14. 14
    DeepSeek-V3.0324TencentMaaS
    需工程修复
    71/100

    命理有自刑等合理推导,但建议含保健品等不当内容,现实信号稍空泛。

    查看四维得分与原文依据
    命理依据18/25
    现实洞察19/25
    行动建议16/25
    中文表达18/25
    午午自刑暗示合作方临时变卦风险。需注意农历五月、十一月

    两轮分差 1

    查看该次完整输出 ↗
  15. 15
    GLM-5.1TencentMaaS
    需工程修复
    46/100

    命理逻辑有断裂,现实信号不完整,建议缺失,内容截断,表达不完整。

    查看四维得分与原文依据
    命理依据12/25
    现实洞察13/25
    行动建议10/25
    中文表达11/25
    恋爱婚姻

    两轮分差 6

    查看该次完整输出 ↗

ENGINEERING STATUS

内容得分之外的工程状态

格式问题不会改写 AI 内容分。4 个输出需要 JSON 修复或补齐字段;HY3、小米与 GPT 追加批次的延迟不参与跨批次比较。

15 个有效输出的工程状态
排名模型内容分JSON字段延迟输出原文
01GLM-5V-TurboTencentMaaS94通过完整88.4 秒2,400 Token查看 ↗
02DeepSeek-V4-FlashTencentMaaS94通过完整21.5 秒1,564 Token查看 ↗
03GPT-5.6 Terra (max)Codex CLI / ChatGPT OAuth94通过完整122.0 秒*3,966 Token查看 ↗
04GPT-5.6 Sol (max)Codex CLI / ChatGPT OAuth93通过完整130.9 秒*4,408 Token查看 ↗
05MiniMax-M2.5TencentMaaS92通过完整27.2 秒2,045 Token查看 ↗
06MiniMax-M2.7TencentMaaS92需修复不完整85.8 秒1,872 Token查看 ↗
07DeepSeek-V3.2TencentMaaS91通过完整39.2 秒1,309 Token查看 ↗
08DeepSeek-V4-ProTencentMaaS90通过完整43.7 秒1,616 Token查看 ↗
09Hy3 PreviewTencentMaaS90通过完整43.7 秒977 Token查看 ↗
10Xiaomi MiMo V2.5 ProXiaomi MiMo Token Plan90通过完整61.8 秒*1,258 Token查看 ↗
11HY3CloudBase AI89通过完整23.9 秒*869 Token查看 ↗
12GPT-5.6 Luna (max)Codex CLI / ChatGPT OAuth89通过完整120.2 秒*3,919 Token查看 ↗
13GLM-5TencentMaaS84需修复不完整42.5 秒2,400 Token查看 ↗
14DeepSeek-V3.0324TencentMaaS71需修复不完整27.0 秒794 Token查看 ↗
15GLM-5.1TencentMaaS46通过不完整52.1 秒2,400 Token查看 ↗

* HY3 走 CloudBase AI 独立批次;Xiaomi MiMo V2.5 Pro 与三个 GPT 模型来自其他追加批次。它们的延迟只作记录。

JUDGING PROTOCOL

AI 盲评怎样产生

同一份匿名固定样本:事业与财富得分较高、健康得分较低,用于检验模型能否解释高机会与高风险并存的年度状态。

  1. 01

    命理依据是否解释大运、流年、藏干、十神与岁运并临,而不是只堆术语

  2. 02

    是否把事业、财富、关系与健康的强弱翻译成具体体感和现实信号

  3. 03

    行动建议是否明确、克制、可执行,能够回应高机会与高风险并存的状态

  4. 04

    中文是否自然、清晰、有节奏,适合面向用户的产品阅读

JudgeTencent MaaS · hy3-preview

temperature 0.2

盲评方式隐藏模型名并重排顺序

至少 2 轮独立评分

分歧处理分差超过 10 分

触发第三轮,按各维中位数聚合

评分版本fortune-content-v1

2026-07-22

工程记录另算

API 调用状态 · JSON 可解析性 · 字段完整性 · 输出截断 · 延迟与输出 Token

查看主批次运行记录 ↗

LIMITATIONS

这份排名不能说明什么

它是固定样本上的内容质量复评,不是命理有效性证明,也不是通用中文能力排名。

单一样本

这是单一匿名固定样本,不代表模型在所有命理任务上的平均水平。

专题内分数

内容得分由 AI Judge 在匿名、乱序条件下按专题 rubric 生成,只适用于本次固定样本,不是全站综合评分。

批次不同

HY3、小米与 GPT 模型来自后续独立批次和不同 Provider 路径,因此延迟不宜跨批次直接排名。

调用差异

GPT 三个模型通过 Codex CLI 独立临时会话生成,显式使用 max 推理强度;CLI 不提供 temperature、max_tokens 或独立 system-role 参数。

非科学验证

本专题评估中文产品输出质量与结构稳定性,不验证命理预测是否具有科学有效性;Judge 也可能存在模型偏好。

PROVENANCE

来源与机器数据

结构化镜像同时保留 15 个有效输出、AI Judge 逐轮分数和原始运行记录。