第 04 期 · 正文写作 · 年代篇 · 2026.09.04

同一章纲写正文 · 年代题材

题材是年代文:1979 年盛夏,现代社畜猝死穿越,附身北京什刹海一个寄居二叔檐下的孤儿。 大纲、章纲、人物设定完全一致,每个模型独立生成三篇,互不参照。 91 份测评员评分全程双盲,即打分的人只看得到四位数随机编号,不知道出自什么模型。

0参评模型
0匿名作品
0有效评分
0评分维度
01

总榜:Kimi K3 登顶,但没有一项维度第一

总榜按测评员给出的整体分排序。Kimi K3 总分第一,五个单项都没进前二。点击维度可切换榜单。

第一档

Kimi K3 · Gemini 3.7 Flash · Gemini 3.1 Pro

6.87 至 7.19

第二档

GLM-5.3 · GPT-5.6 Luna · Qwen3.8 Max

6.23 至 6.62

第三档

DeepSeek V4 Pro · GPT-5.6 Terra · Grok 4.6 · DeepSeek V4 Flash

4.67 至 5.83

Kimi K3 赢总分,Gemini 3.7 Flash 赢单项

Kimi K3 拿了总分第一,但它在五个维度里没有一项进前二: 网文感第 5、人物描写第 3、细节描写第 5、逻辑严密第 8、AI 感第 5。 而总分第二的 Gemini 3.7 Flash,五个维度里拿了四个第一。

总评分记录整篇的阅读感受,五个维度分别打分。两组数据分开统计,因此整体读感和单项能力会给出不同排名。

Kimi K3 的 7.19 靠的是三篇里那篇 8.00(), 另两篇是 7.36 和 6.20;它的逻辑严密只有 4.76,排第 8,短板相当明显。 那篇 8.00 最终采用两份评分,第三位测评员给出的 4.5 分触发异常值规则,被剔除。 给出高总分的两位测评员,五个维度的平均分只有 4.20 和 6.50, 总分比维度分高出 3.8 和 1.5。这种「整体印象远好于逐项拆解」的落差,Kimi K3 是全场最大的(平均 +1.15), 而 Gemini 3.7 Flash 几乎没有(+0.18)。 Gemini 3.7 Flash 各项最均衡,代表作 得 7.87 分。 看均衡性,选 Gemini 3.7 Flash;看单篇上限,Kimi K3 更高。

前三名只差 0.32 分,第一到第五只差 0.57 分,差距没有统计显著性。因此只分档,不细排名次。

02

五维拆解:谁强在哪,谁塌在哪

「逻辑问题」和「AI 感」已换算成质量分(10 减原分),五项都是高分更好。可任选两个模型对比。

径向刻度 2 至 8 分,覆盖全部实际得分

模型 A
模型 B
03

细节质感:堆字数堆不出年代感

章纲要求三千字左右,实际平均 4,628 字,三分之一超过 5,000 字。篇幅与得分几乎无关。

各模型平均篇幅从 3,240 字到 6,519 字,最长接近最短的两倍。 篇幅与总分的相关系数只有 0.14,与细节分的相关系数为 0.45。多写通常没有多拿分。

篇幅与细节分对照

灰条是平均篇幅,绿条是细节描写分。两者并不同步。

Gemini 3.7 Flash 用 4,631 字拿到全场最高的细节分 6.93; GLM-5.3 多写 40%(6,519 字,单篇最长 8,052 字),细节分为 6.86。 Gemini 3.1 Pro 平均只有 3,240 字,是全场最短,细节分 6.27 排第四, 比写了 5,099 字的 DeepSeek V4 Flash(5.27)整整高一分。

GPT-5.6 Terra 平均写 3,979 字,细节分只有 4.30,比倒数第二的 Grok 4.6 低 0.85。

04

稳定性:同一套输入,跑三次

每个点代表一次生成,横条是三次的分数跨度,竖线是均分。极差从 0.46 到 4.50,越小越稳。

单次生成得分 三次均分 右侧数字为极差

Luna 最稳

GPT-5.6 Luna 极差 0.46 全场最小,三篇 6.78 / 6.76 / 6.32, 最高分不突出,最低也没跌破 6.3。追求稳定交付可以优先看它。

最高的一篇,来自第七名

全场最高的一篇来自总榜第七:DeepSeek V4 Pro 写出了 8.50 (), 另外两篇只有 5.00 和 4.00,极差 4.50。想碰到高分稿,往往要多跑几次。

05

钱花在哪:选对的,不只选贵的

GPT-5.6 Luna 和 GLM-5.3 性价比不错,推荐日常使用。

第一名 Kimi K3 每章 $0.074。第二名 Gemini 3.7 Flash 只要一半,第四名 GLM-5.3 约为三分之一。 GPT-5.6 Terra 每章 $0.0725,价格第二,排名第八。DeepSeek V4 Flash 每章 $0.0035,价格最低,总分也垫底。

06

测评员原话

共收录 86 条评分原话,未经润色。点击评语可读对应作品。

07

30 篇原文,全部公开

点击任意一篇,可查看全文、六项分数和全部评语。

08

方法与局限

评分方法和适用范围。

数据怎么处理的

双盲

测评员只看到匿名编号,模型名称、他人评分和评审进度均隐藏。编号与模型的对应关系只在管理端保存。

异常值剔除

各评分列单独判断。分数同时满足「偏离该篇中位数超过 2.5 × MAD」和「偏离超过 2 分」时剔除。本期 21 篇触发规则,共剔除 53 项;另有 1 篇进入复核。

样本可用性筛查

每位测评员的评分都做内部一致性检验,判别力不足的整批排除。本次排除 8 份。

样本量

每个模型生成 3 篇,每篇有 3 至 4 份评分,共 91 份。专家组补齐了评分不足的作品。

这份结果的边界

样本量偏小

每个模型仅 3 篇。DeepSeek V4 Pro(极差 4.50)、Qwen3.8 Max(2.75)这类波动大的模型,均分参考价值有限,看稳定性点图比看名次可靠。

维度结论不宜单独引用

部分维度的评分区分度不足,单项结果要谨慎使用。总分单独统计。

只测了第一章

本次只测开篇,实际平均 4,628 字。长篇节奏、伏笔回收和人物弧光不在评估范围内。

「AI 感」主观性最强

测评员对 AI 痕迹的判断会有差异。本期 AI 感质量分均值为 3.99,解读时要留意这种主观性。

题材变化、跨期轨迹和版本对比见 第 05 期 · 三题材横向对比

附录:十个模型拿到的是同一份大纲

项目定位

年代文 / 七十年代末 / 京味市井 / 文抄公金手指。

故事梗概:「1979 年的北京什刹海,现代社畜猝死穿越,成了寄居二叔家、随时会被遣返的『盲流』孤儿。」

第一章:什刹海的狼

穿越者在盛夏的荷花市场边醒来,饿得眼前发黑,随即面对街道办的遣返通牒与二叔一家的霸产欺凌。三个场景:

  • 饿醒(生理 / 年代感):醒来先感到饿。用触觉和嗅觉写淤泥、鱼腥和汗臭,避免用上帝视角交代背景。
  • 遣返通牒(冲突 / 处境):街道办上门,「盲流」身份随时可能被送走。要求通过对话和邻里围观写出时代压力。
  • 霸产(人物 / 反差):二叔林德柱一家占着正房,主角必须在示弱与反击之间做选择。

结尾钩子:他想起前世读过的小说,在这里触发「文抄公」金手指。多个模型把这个转折写得很生硬。

篇幅要求 3000 字左右。本期实际平均 4,628 字,最长的一篇 8,052 字。

来打分

感谢本期测评员

武行悟道雪白的面具lastworm流萤King长庚上帝模式笑沧桑海獭慕容复国在天子家喝茶方周兴sunHubert坚强老鸭梨Sail泡在海岛的猴子Sandra

常看网文,也愿意认真打分?可以加入测评团。

加入测评团 →
点菜

下一期想看什么测评?

写下想测的题材、模型或写作环节。