第 05 期 · 三题材横向对比 · 2026.09.04

AI写正文 · 题材对比

仙侠、脑洞、年代,三次测评共 90 篇作品、306 份双盲评分。

0题材
0涉及模型
0匿名作品
0有效评分
01

题材横向比较

三期的评分维度、评委分组和加权规则相同,题材考点不同。

三期均分为 5.80、6.04、6.17,最大相差 0.37 分。整体评分松紧接近,跨期对比有基本可比性。

不同题材,分数差在哪

下面是每期十个模型的维度均分。

脑洞题材:网文感天然占便宜

网文感均分 6.53,比仙侠(5.88)和年代(5.69)高出大半分。 「微信群里蹦出牛顿」本身就有爽点和冲突。逻辑分也最低,只有 5.35。设定越跳,越难圆。

年代题材:逻辑最稳,网文感最难

逻辑均分 5.78 是三期最高,网文感 5.69 是三期最低。 年代文顺着生活逻辑写,硬伤相对少。难点是把粮票、筒子楼这些细节写真,同时把故事写得好看。

AI 感这一项的质量分连续三期下滑,从 4.36 降到 4.16,再降到 3.99,且每期都排在五个维度末位。 机器味仍是最普遍的问题。

篇幅与得分的相关系数,脑洞题材是 0.71,年代题材只有 0.14。 脑洞文要铺设定,字数不够讲不清楚;年代文靠选对细节,堆字数堆不出年代感。

侧重点不同,榜就重排

脑洞篇和年代篇同一天入库,由同一批评委在同一时期评完,适合直接看题材带来的变化。

左边是脑洞名次,右边是年代名次。模型和评委相同。

跌得最狠:DeepSeek V4 Flash

脑洞第 6(5.92)→ 年代第 10(4.67),掉了 4 名、1.25 分。 它在脑洞题材的网文感有 7.30(全场第二),到年代题材只剩 5.32; 洁净分也从 4.62 掉到 2.31。

升得最猛:Kimi K3

脑洞第 4(6.28)→ 年代第 1(7.19)。 它在脑洞题材写出过 8.00 也写出过 4.33,极差 3.67; 到年代题材三篇收敛到 8.00 / 7.36 / 6.20,稳住了就登顶。

十个模型里有八个换题材后名次发生了变化,只有 DeepSeek V4 ProGPT-5.6 Terra 纹丝不动(都是第 7 和第 8)。 同一模型换题材后的分差,可能比模型之间的分差更大。选模型时要先看题材。

谁擅长哪个题材

Gemini 3.1 Pro
稳定头部

三期名次 1 / 1 / 3,总分极差只有 0.66。目前唯一不挑题材的模型。

Qwen3.8 Max
仙侠相对好

仙侠第 4 是它三期最好的名次(此后第 9、第 6)。架空世界观这道题它答得最顺。

DeepSeek V4 Flash
脑洞相对好

脑洞第 6,前后两期分别第 9、第 10。脑洞篇它的网文感冲到 7.30,全场第二。

Kimi K3
年代相对好

年代篇登顶(7.19),年代细节写得又真又稳。三期名次 5 → 4 → 1,一路向上。

每个模型每期只有三篇,以上只看倾向。详细限制见文末。

02

章纲也会拉开差距

三期都让模型拿章纲直接写正文,三份章纲的来源和质量不同。

章纲质量
第 02 期 · 仙侠
AI 章纲 · 普通质量

AI 直接生成,未经打磨。

第 04 期 · 年代
AI 章纲 · 优化过

AI 生成后做过人工优化。

第 03 期 · 脑洞
真人作者 · 真实章纲

来自已发表作品,节奏、冲突和钩子更完整。

章纲的质量,非常影响正文的质量。同样是无提示词直出,好章纲能带来更好的表现; 章纲里带着 AI 味,正文的 AI 味就很难去干净。

真人章纲更会搭台

脑洞篇的网文感均分 6.53,三期最高。题材本身有优势,真人章纲也提前搭好了节奏、冲突和钩子。 模型只需把它们写出来。

去 AI 味要从章纲动手

章纲会定下正文的结构和表达习惯。只改正文,往往改不干净。章纲和正文都要处理。

三期分差里混有章纲质量的影响,不能直接按均分判断模型强弱。 做 AI 写作流程时,章纲质量要和正文质量一起管。

03

走完三期的四个模型

这四个模型连续参加了仙侠、脑洞和年代三期测评。

第二轮名单保留了仙侠篇第一名 Gemini 3.1 Pro、国产前两名 Qwen3.8 MaxKimi K3, 以及当时新发布的 DeepSeek V4 Flash,用于和后续加入的 DeepSeek V4 Pro 对照。

Gemini 3.1 Pro 是唯一三期都待在第一梯队的模型(1 / 1 / 3 名),三期极差只有 0.66。 Kimi K3 一路向上,从仙侠的第 5 走到年代的第 1。 DeepSeek V4 Flash 三期极差 1.25,是四个里最看题材的一个。 Qwen3.8 Max 在脑洞题材有一次明显的塌陷(第 4 → 第 9 → 第 6)。

04

模型纵向比较

GLM 和 Gemini Flash 看版本变化;GPT-5.6 看同一系列的三个型号。

版本升级:GLM 与 Gemini Flash

GLM-5.2 → GLM-5.3 是最成功的一次升级:脑洞 +0.63,年代 +1.17, 每章成本从 $0.018 涨到 $0.0233,多花三成钱换来一个档位的提升。 Gemini 3.6 → 3.7 Flash 成本不变,两个题材 +0.20 / +0.42。

新旧版测的是不同题材和章纲,涨幅只能参考。两组新版在脑洞和年代都涨分,方向较一致。 最新发布的 Gemini 3.8 Flash,我们也会尽快安排进下一期测评。

GPT-5.6 Sol / Luna / Terra:同一系列的三个模型

Sol、Luna、Terra 是 GPT-5.6 系列的三个不同模型。按每章价格看,Sol 是旗舰型号,Terra 居中,Luna 是轻量型号,三者最多相差五倍。

GPT-5.6 Sol
$0.145 / 章
仙侠 6.40 (第 02 期 · 第 3 名)
GPT-5.6 Luna 写作更优
$0.029 / 章
脑洞 6.66 · 年代 6.62
GPT-5.6 Terra
$0.0725 / 章
脑洞 5.33 · 年代 5.43

Luna 与 Terra 使用相同题材和评委,适合直接对比: 脑洞差 1.33 分,年代差 1.19 分,而 Terra 每章还贵 1.5 倍。 这两期写网文,价格最低的轻量型号 Luna 得分更高,成本也更低 (两榜详见 第 03 期 · 脑洞篇第 04 期 · 年代篇)。

Sol 只参加了仙侠篇,题材和评委都不同,不能和另外两个直接比:它拿到第 3 名,但每章 $0.145,是三个型号里最贵的。

05

这些比较在什么范围内成立

跨期对比受题材、章纲、评委和样本量影响。

题材对比最可靠
脑洞篇和年代篇同一天入库,由同一批评委在同一时期完成。主要变量是题材及配套章纲。
三期轨迹看适应性
三期评分口径一致,均分最大相差 0.37 分。题材不同,评委人数也有变化,因此轨迹适合看跨题材表现,不能当作模型能力随时间的变化。
版本涨幅只供参考
新旧版测了不同题材和章纲,分差混有其他因素。GPT-5.6 Luna 与 Terra 的同期对照更直接。
章纲来源不同
仙侠用普通 AI 章纲,年代用人工优化过的 AI 章纲,脑洞用已发表作品的真人章纲。三期均分不能直接排高低。
样本规模
每个模型每期只有三篇。波动大的模型均分参考价值较低,名次变化也会受随机性影响。

各期的完整榜单、维度拆解与全部原文: 第 02 期 · 仙侠篇 · 第 03 期 · 脑洞篇 · 第 04 期 · 年代篇