题材横向比较
三期的评分维度、评委分组和加权规则相同,题材考点不同。
三期均分为 5.80、6.04、6.17,最大相差 0.37 分。整体评分松紧接近,跨期对比有基本可比性。
不同题材,分数差在哪
下面是每期十个模型的维度均分。
脑洞题材:网文感天然占便宜
网文感均分 6.53,比仙侠(5.88)和年代(5.69)高出大半分。 「微信群里蹦出牛顿」本身就有爽点和冲突。逻辑分也最低,只有 5.35。设定越跳,越难圆。
年代题材:逻辑最稳,网文感最难
逻辑均分 5.78 是三期最高,网文感 5.69 是三期最低。 年代文顺着生活逻辑写,硬伤相对少。难点是把粮票、筒子楼这些细节写真,同时把故事写得好看。
AI 感这一项的质量分连续三期下滑,从 4.36 降到 4.16,再降到 3.99,且每期都排在五个维度末位。 机器味仍是最普遍的问题。
篇幅与得分的相关系数,脑洞题材是 0.71,年代题材只有 0.14。 脑洞文要铺设定,字数不够讲不清楚;年代文靠选对细节,堆字数堆不出年代感。
侧重点不同,榜就重排
脑洞篇和年代篇同一天入库,由同一批评委在同一时期评完,适合直接看题材带来的变化。
左边是脑洞名次,右边是年代名次。模型和评委相同。
跌得最狠:DeepSeek V4 Flash
脑洞第 6(5.92)→ 年代第 10(4.67),掉了 4 名、1.25 分。 它在脑洞题材的网文感有 7.30(全场第二),到年代题材只剩 5.32; 洁净分也从 4.62 掉到 2.31。
升得最猛:Kimi K3
脑洞第 4(6.28)→ 年代第 1(7.19)。 它在脑洞题材写出过 8.00 也写出过 4.33,极差 3.67; 到年代题材三篇收敛到 8.00 / 7.36 / 6.20,稳住了就登顶。
十个模型里有八个换题材后名次发生了变化,只有 DeepSeek V4 Pro 和 GPT-5.6 Terra 纹丝不动(都是第 7 和第 8)。 同一模型换题材后的分差,可能比模型之间的分差更大。选模型时要先看题材。
谁擅长哪个题材
三期名次 1 / 1 / 3,总分极差只有 0.66。目前唯一不挑题材的模型。
仙侠第 4 是它三期最好的名次(此后第 9、第 6)。架空世界观这道题它答得最顺。
脑洞第 6,前后两期分别第 9、第 10。脑洞篇它的网文感冲到 7.30,全场第二。
年代篇登顶(7.19),年代细节写得又真又稳。三期名次 5 → 4 → 1,一路向上。
每个模型每期只有三篇,以上只看倾向。详细限制见文末。
章纲也会拉开差距
三期都让模型拿章纲直接写正文,三份章纲的来源和质量不同。
AI 直接生成,未经打磨。
AI 生成后做过人工优化。
来自已发表作品,节奏、冲突和钩子更完整。
真人章纲更会搭台
脑洞篇的网文感均分 6.53,三期最高。题材本身有优势,真人章纲也提前搭好了节奏、冲突和钩子。 模型只需把它们写出来。
去 AI 味要从章纲动手
章纲会定下正文的结构和表达习惯。只改正文,往往改不干净。章纲和正文都要处理。
三期分差里混有章纲质量的影响,不能直接按均分判断模型强弱。 做 AI 写作流程时,章纲质量要和正文质量一起管。
走完三期的四个模型
这四个模型连续参加了仙侠、脑洞和年代三期测评。
第二轮名单保留了仙侠篇第一名 Gemini 3.1 Pro、国产前两名 Qwen3.8 Max 与 Kimi K3, 以及当时新发布的 DeepSeek V4 Flash,用于和后续加入的 DeepSeek V4 Pro 对照。
Gemini 3.1 Pro 是唯一三期都待在第一梯队的模型(1 / 1 / 3 名),三期极差只有 0.66。 Kimi K3 一路向上,从仙侠的第 5 走到年代的第 1。 DeepSeek V4 Flash 三期极差 1.25,是四个里最看题材的一个。 Qwen3.8 Max 在脑洞题材有一次明显的塌陷(第 4 → 第 9 → 第 6)。
模型纵向比较
GLM 和 Gemini Flash 看版本变化;GPT-5.6 看同一系列的三个型号。
版本升级:GLM 与 Gemini Flash
GLM-5.2 → GLM-5.3 是最成功的一次升级:脑洞 +0.63,年代 +1.17, 每章成本从 $0.018 涨到 $0.0233,多花三成钱换来一个档位的提升。 Gemini 3.6 → 3.7 Flash 成本不变,两个题材 +0.20 / +0.42。
新旧版测的是不同题材和章纲,涨幅只能参考。两组新版在脑洞和年代都涨分,方向较一致。 最新发布的 Gemini 3.8 Flash,我们也会尽快安排进下一期测评。
GPT-5.6 Sol / Luna / Terra:同一系列的三个模型
Sol、Luna、Terra 是 GPT-5.6 系列的三个不同模型。按每章价格看,Sol 是旗舰型号,Terra 居中,Luna 是轻量型号,三者最多相差五倍。
Luna 与 Terra 使用相同题材和评委,适合直接对比: 脑洞差 1.33 分,年代差 1.19 分,而 Terra 每章还贵 1.5 倍。 这两期写网文,价格最低的轻量型号 Luna 得分更高,成本也更低 (两榜详见 第 03 期 · 脑洞篇 与 第 04 期 · 年代篇)。
Sol 只参加了仙侠篇,题材和评委都不同,不能和另外两个直接比:它拿到第 3 名,但每章 $0.145,是三个型号里最贵的。
这些比较在什么范围内成立
跨期对比受题材、章纲、评委和样本量影响。
- 题材对比最可靠
- 脑洞篇和年代篇同一天入库,由同一批评委在同一时期完成。主要变量是题材及配套章纲。
- 三期轨迹看适应性
- 三期评分口径一致,均分最大相差 0.37 分。题材不同,评委人数也有变化,因此轨迹适合看跨题材表现,不能当作模型能力随时间的变化。
- 版本涨幅只供参考
- 新旧版测了不同题材和章纲,分差混有其他因素。GPT-5.6 Luna 与 Terra 的同期对照更直接。
- 章纲来源不同
- 仙侠用普通 AI 章纲,年代用人工优化过的 AI 章纲,脑洞用已发表作品的真人章纲。三期均分不能直接排高低。
- 样本规模
- 每个模型每期只有三篇。波动大的模型均分参考价值较低,名次变化也会受随机性影响。
各期的完整榜单、维度拆解与全部原文: 第 02 期 · 仙侠篇 · 第 03 期 · 脑洞篇 · 第 04 期 · 年代篇