第 02 期 · 正文写作 · 仙侠篇 · 2026.08.10

同一章纲写正文 · 仙侠题材

题材是暗黑西游:主角穿越成龟丞相最不受宠的十三子,在龙宫死牢里醒来。 大纲、章纲、人物设定完全一致,每个模型独立生成三篇,互不参照。 117 份测评员评分全程双盲,即打分的人只看得到四位数随机编号,不知道出自什么模型。

0参评模型
0匿名作品
0有效评分
0评分维度
01

看结果之前,先押一注

凭直觉:这十个模型里,谁写网文写得最好?选一个,然后看看你的直觉准不准。

02

总榜:换个维度,榜就重排一次

排名依据「总评分」——它是测评员独立填写的字段,不由五个维度加权算出。 点下面的维度看榜单怎么洗牌:第一名并不是每项都第一。

第一档

Gemini 3.1 Pro · Gemini 3.6 Flash · GPT-5.6 Sol

6.40 — 6.78

第二档

Qwen3.8 Max · Kimi K3

6.08 — 6.28

第三档

Hy3 · GLM-5.2 · Claude Opus 5 · DeepSeek V4 Flash · Claude Fable 5

4.82 — 5.51

第一档三个模型之间 0.18 — 0.20 的差距不具备统计显著性,所以报告采用分档,而不是把名次咬死。

03

五维拆解:谁强在哪,谁塌在哪

「逻辑问题」和「AI 感」原本越低越好,这里统一转成质量分(10 − 原分),五项都是越高越好。 挑两个模型比一比。

径向刻度 2 — 8 分(全部模型的实际得分都落在这个区间内)

模型 A
模型 B
04

稳定性:同一套输入,跑三次

每个点是一次生成,横条是三次之间的跨度,竖线是均分。极差最小的 0.22,最大的 2.56,相差十倍以上。 把鼠标放到点上看具体分数。

单次生成得分 三次均分 右侧数字为极差

稳,不等于好

Claude Fable 5 极差 0.22 全场最小,但三篇都卡在 4.7 — 4.9。 这说明它的问题是系统性的,重跑不会变好。

又高又稳,只有一个

GPT-5.6 Sol 均分第 3、极差 0.23,每次交付都在同一水平线。 Claude Opus 5 则最好一篇 6.23 能进全场前 12,最差一篇 3.67 全场垫底。

05

钱花在哪:163 倍价差,1.4 倍质量差

横轴是每章成本(对数刻度),纵轴是总分。如果贵有贵的道理,点应该沿着对角线排列——它们没有。

第一档(6.40 分以上) 第二、三档

成本按固定 token 数估算,未计入重试、超长输出与人工精修工时。

第 2 名 Gemini 3.6 Flash 的单章成本是第 3 名 GPT-5.6 Sol 的 1/4,分数还高 0.18。 第 8 名 Claude Opus 5 的成本是第 6 名 Hy3 的 60 倍,分数低 0.34。 排名与价格几乎不相关。

06

AI 感是全场通病

十个模型有六个的 AI 感得分超过 5.5(越低越好)。多位测评员各自独立点名了同一批句式。 下面这个检测器就按他们点名的清单来数——粘一段你自己的文字试试。

示例是为演示写的片段,不是参评作品。检测只做字面匹配,不是模型判别器—— 测评员判断「AI 感」靠的是整体阅读体验,这里只是把他们反复点名的痕迹标出来。

0 等待输入
标记结果 句式套路 高频动作词 比喻与标点习惯

开天眼

模型读了大纲之后,让角色说出他本不该知道的信息,行为逻辑随之崩坏。 专家和资深测评员多次独立指出,这是本次最影响阅读体验的结构性问题。

头尾最容易露馅

多位测评员观察到同一现象:中间段落质量尚可,但开篇的环境描写和结尾的总结升华最容易暴露 AI 特征。

不理解「金手指」的位置

章纲要求结尾处触发金手指,多个模型把它处理成普通剧情推进, 没意识到这是网文留钩子的位置。

第一名也没躲过

Gemini 3.1 Pro 拿下五个维度中的四个第一,AI 感却只排第 4。 写得最像样,AI 痕迹却不是最淡的。

07

那我该用哪个

回答两个问题,给你报告第八节里对应的那条建议。

一、成本敏感度

二、生成之后

两项都选好之后,这里会给出对应的模型和理由。

以上成本仅为 API 调用费用。多位测评员对第一档模型的评价是「稍微精修一下就可以发了」, 对末档的评价是「完全不适合网文」。把精修工时折算进去,模型之间的实际总成本差距会与 API 价格差距相反。

08

测评员原话

感谢来自 SoloEnt 社群的热心测评员,他们耐心给出了 148 条评语。 以下全部出自评分时的原始提交,未作润色,点任意一条可以直接读它评的那一篇。

测评员讨论

盲评结束后,我们发现 Fable 5 和 Opus 5 远低于我们想象中的得分,引发了一场讨论。

由于我们提供了严格的章纲,而章纲并不完美:一方面它由 AI 输出,另一方面它给出了过多的细节限制。

有测评员认为

Fable 5 和 Opus 5 表现出对章纲的过度遵守,导致正文表现很差,也侧面展现了模型的死板之处。

也有测评员认为

这正反映了 coding 能力强的模型在创意写作(creative writing)上的欠缺,他们缺乏写作需要的灵性。

09

30 篇原文,全部公开

评审读到的就是这些。点开任意一篇,能看到全文、它拿到的六项分数, 以及所有评审对这一篇写下的原话。

10

方法与局限

怎么打的分,以及这份结果不能用来说明什么。

数据怎么处理的

双盲

测评员只看到匿名编号,看不到模型名称、其他人的评分,以及自己之外的任何评审进度。编号与模型的映射只存在于管理端。

异常值剔除

每一列独立判定。某个分数要同时满足「偏离该篇中位数超过 2.5 × MAD」「偏离值超过 2 分」才被剔除。30 篇里有 28 篇触发了至少一处剔除。

样本可用性筛查

对每位测评员的评分做内部一致性检验,判别力不足的样本整批排除,不计入任何统计。本次共排除 8 份。

样本量

每个模型 3 个版本,每篇 3 — 5 份测评员评分,另加 1 份内部专家评分。

这份结果的边界

样本量偏小

每个模型仅 3 篇。第一档三个模型之间的差距不具备统计显著性,故采用分档而非精确排名。

维度结论不宜单独引用

部分评分在个别维度上区分度不足,会削弱维度拆解的可靠性。总分排名不受此影响。

只测了第一章

所有判断基于 3,000 字的开篇。节奏控制、伏笔回收、人物弧光等需要更长篇幅才能评估的维度,本次未覆盖。

「AI 感」主观性最强

该维度得分普遍偏高且离散度大,不同测评员对「什么算 AI 痕迹」的理解未必一致。它同时是唯一改变模型排序的维度,解读时需格外谨慎。

附录:十个模型拿到的是同一份大纲

项目定位

《西游:龙宫葬地,苟道长生》——暗黑西游 / 稳健苟道 / 权谋算计 / 凡人流升级。

核心一句话:「在这吃人的西游世界,我归元不求成佛作祖,只求熬死在座的各位,把你们的骨灰扬了,顺便接收你们的遗产。」

第一章:龙宫死牢,第 9527 号狱卒

穿越成龟丞相庶子的归元,在阴冷潮湿的死牢中醒来,面对上司蟹老三的刁难,被迫去处理一具剧毒的海蛇尸体。三个场景:

  • 死牢苏醒(压抑 / 冰冷):墙壁渗出的不是水,是黑色的死气。要求强调「冷」「湿」「黑」,不要大段独白,通过观察环境侧面反映内心。
  • 上司刁难(冲突 / 反差):原身自卑又自傲,穿越后却跪地求饶自称「小的」。示敌以弱,是为了更好地一击毙命。
  • 走向深渊(氛围 / 铺垫):穿过关押疯狂犯人的走廊,抵达丁字区那具散发幽绿毒气的海蛇尸体。

结尾钩子:指尖触碰鳞片的瞬间,一股冰冷的寒流钻入体内,脑海中响起一声如磨盘转动的轰鸣——这就是章纲要求触发金手指的位置,也是多个模型没接住的地方。

篇幅要求 3000 字左右。有模型写到了 5,500 字。

来打分

感谢本期测评员

武行悟道alikezklastworm流萤King长庚笑沧桑海獭慕容复国无语在天子家喝茶瑞天阁主zsqSandra

我们的测评团还在持续招募有网文深度阅读经验的同学,欢迎加入我们!

加入测评团 →
点菜

下一期想看什么测评?

想看测评什么品类,什么模型,或什么环节,快让我们知道吧。