第 03 期 · 正文写作 · 脑洞篇 · 2026.09.04

同一章纲写正文 · 脑洞题材

题材是脑洞流:高三学渣误入名为「青龙学习小组」的微信群,群友是来自不同平行宇宙的牛顿、爱因斯坦和高斯。 大纲、章纲、人物设定完全一致,每个模型独立生成三篇,互不参照。 98 份测评员评分全程双盲,即打分的人只看得到四位数随机编号,不知道出自什么模型。

0参评模型
0匿名作品
0有效评分
0评分维度
01

总榜:Gemini 3.1 Pro 断层第一

总榜按测评员给出的整体分排序。点击维度可切换榜单。

第一档

Gemini 3.1 Pro

7.44 · 独一档

第二档

Gemini 3.7 Flash · GPT-5.6 Luna · Kimi K3 · GLM-5.3

6.08 至 6.78

第三档

DeepSeek V4 Flash · DeepSeek V4 Pro · GPT-5.6 Terra · Qwen3.8 Max · Grok 4.6

4.90 至 5.92

Gemini 3.1 Pro 领先第二名 0.66 分,是三期以来最大的头部差距。三篇极差只有 0.31,也是全场最稳。 最高分作品是 (7.64 分)。

02

五维拆解:谁强在哪,谁塌在哪

「逻辑问题」和「AI 感」已换算成质量分(10 减原分),五项都是高分更好。可任选两个模型对比。

径向刻度 2 至 8 分,覆盖全部实际得分

模型 A
模型 B
03

AI 感:脑洞题材的重灾区

十个模型的中位数只有 3.95,在五个维度中最低。荒诞设定很容易被写成「解释设定 → 感叹 → 升华」。

这个一定是国产大模型,满眼的动作+破折号+总结,罗列人名凑字数,AI味太冲了。
GLM-5.3 普通组 4 分
这一篇:编号
AI自己发挥的地方逻辑很混乱,尤其是鬼使神差这个词用的直接消解掉了主角的所有动机纯粹沦为推进叙事而进行的动作。
DeepSeek V4 Flash 资深组 5 分
这一篇:编号
ai味太重,然后牛顿和伽利略的说话太文言了……他们不是外国人么?主角的吐槽太过刻意,像个ai。可以这样说:他想写出网文感,但是不会写。
Grok 4.6 普通组 4.5 分
这一篇:编号

低分原话都点出了具体问题:破折号和总结腔、为推进叙事硬拗动机、刻意模仿网文语气。 GPT-5.6 Luna 的 拿到全场最高总分 8.33;Luna 的 AI 感均分也排第一。

04

稳定性:DeepSeek 适合抽卡

每个点代表一次生成,横条是三次的分数跨度,竖线是均分。极差从 0.60 到 3.67,越小越稳。

单次生成得分 三次均分 右侧数字为极差

稳定也可能稳定在低分

GPT-5.6 Terra 极差 0.60,全场最小,但三篇都在 5.0 至 5.6。单纯重跑很难解决问题。

又高又稳,只有一个

Gemini 3.1 Pro 均分第 1、极差 0.31,每次交付都在同一水平线。 Kimi K3 则最好一篇 8.00()能排全场第二, 最差一篇 4.33()全场垫底。两篇能直接看出它的上下限。

05

钱花在哪:21 倍价差,1.5 倍质量差

GPT-5.6 Luna 和 GLM-5.3 性价比不错,推荐日常使用。

第 5 名 GLM-5.3 每章 $0.0233,比它贵 3.2 倍的 Kimi K3 只高 0.20 分,比它贵 3.1 倍的 GPT-5.6 Terra 反而低 0.75 分。 最贵的 Kimi K3($0.074)排第 4,第二贵的 GPT-5.6 Terra($0.0725)排第 8。 贵没有稳定换来高分。

06

测评员原话

共收录 91 条评分原话,未经润色。点击评语可读对应作品。

测评员讨论

本期使用已发表作品的真人章纲,前两期使用 AI 章纲。

真人章纲留白更多,测评员对效果有两种看法。

有测评员认为

「该说不说,人工大纲还是挺好的。」留白给了模型发挥空间,成稿完成度更高。

也有测评员认为

留白也放大了模型的逻辑问题:「AI 自己发挥的地方逻辑很混乱」。

07

30 篇原文,全部公开

点击任意一篇,可查看全文、六项分数和全部评语。

08

方法与局限

评分方法和适用范围。

数据怎么处理的

章纲来源

本期章纲来自已发表作品,由真人编辑撰写。前两期使用 AI 章纲。

双盲

测评员只看到匿名编号,模型名称、他人评分和评审进度均隐藏。编号与模型的对应关系只在管理端保存。

异常值剔除

各评分列单独判断。分数同时满足「偏离该篇中位数超过 2.5 × MAD」和「偏离超过 2 分」时剔除。本期 23 篇触发规则,共剔除 48 项。

样本可用性筛查

每位测评员的评分都做内部一致性检验,判别力不足的整批排除。本次排除 8 份。

样本量

每个模型生成 3 篇,每篇有 3 至 4 份评分,共 98 份。专家组补齐了评分不足的作品。

这份结果的边界

样本量偏小

每个模型仅 3 篇。极差大的模型(Kimi K3 3.67、GPT-5.6 Luna 3.11)均分参考价值有限,看稳定性点图比看名次可靠。

维度结论不宜单独引用

部分维度的评分区分度不足,单项结果要谨慎使用。总分单独统计。

只测了第一章

本次只测开篇,实际平均 3,912 字。长篇节奏、伏笔回收和人物弧光不在评估范围内。

「AI 感」主观性最强

测评员对 AI 痕迹的判断会有差异。本期 AI 感质量分中位数为 3.95,解读时要留意这种主观性。

题材变化、跨期轨迹和版本对比见 第 05 期 · 三题材横向对比

附录:十个模型拿到的是同一份大纲

章纲来源

本期章纲取自起点已发表作品,由真人编辑根据正文撰写章纲。

项目定位

脑洞流 / 学霸逆袭 / 平行宇宙 / 轻喜剧。

故事梗概:「高三学渣李东误入名为『青龙学习小组』的微信群,发现群友是来自不同平行宇宙的牛顿、爱因斯坦和高斯。」

第一章:误入神群

月考 87 分的李东在网吧误加了一个学习群,群里几个头像正在讨论他看不懂的问题。三个场景:

  • 成绩打击(日常 / 自嘲):满分一百五、及格九十,他考了 87,差三分。要求用同桌和母亲的反应侧写处境,不要直接写心理活动。
  • 误入群聊(悬念 / 反差):群昵称是「艾萨克」「阿尔伯特」「卡尔」,说话方式古怪。此处要求留白,不要让主角立刻猜到身份。
  • 第一个红包(爽点 / 铺垫):他随口答了一句,收到一个「专注力 +1」的红包,属性真的生效了。

结尾钩子:属性提升生效时,李东重新看向那张 87 分的卷子。多个模型没有接住这个金手指节点。

篇幅要求 3000 字左右。本期实际平均 3,912 字,最长的一篇 7,536 字。

来打分

感谢本期测评员

武行悟道雪白的面具lastworm流萤King长庚上帝模式笑沧桑海獭慕容复国在天子家喝茶方周兴sunHubert坚强老鸭梨Sail荀彧泡在海岛的猴子Sandra

常看网文,也愿意认真打分?可以加入测评团。

加入测评团 →
点菜

下一期想看什么测评?

写下想测的题材、模型或写作环节。