AI 写作不能简单地用一项任务来评估模型能力
能有效引导、会做框架设计、肯照着大纲写、正文写得好,其实是四种能力。 跑完 18 个模型后这种认知会更清晰:这几项能力相关性不大,有些甚至互相拖后腿。
引导互动
Plan 阶段能不能帮作者把模糊的想法问清楚,最后做出能执行的决定。 看的是问题有没有问到点上,不看话多不多。满分 5 分。
结构设计
看策划文件是否齐全,大纲前后能不能接得上,以及三次运行写出来的细致程度是否稳定。满分 5 分。
执行遵从
看正文有没有照着自己先前写好的章纲走。这个分数说明模型好不好控制,不能说明正文好不好看。满分 5 分。
正文创作
真人编辑不看模型名字,只读第一章并按百分制打分,三次取平均。读者最后看到的,就是这一项。
AI 写作没有模型可以称为冠军
每个纬度的排序几乎都不一样,这里默认按真人盲评的正文均分排序。 但正文表现好的模型,可以在执行和遵从上并不是最好的。
五批盲评的时间不同,编辑也可能不同,所以个位数分差不能当成胜负,比如 Step 的 63.3 和 Gemini 的 63.0。 53 篇有效首章里有 23 篇达到 60 分,没有一篇到 80 分。
选两个模型,看看各自强在哪
这里统一换算成 100 分制进行演示。 稳定性按三次成绩的最大差距换算,差得越少,分越高。右边展示保留了原始得分。
径向刻度为换算后的 0 至 100 分
前期做得漂亮,正文却没跟上
Sonnet 5 引导 4.57 全场第一、结构 4.6,正文只有 57.3。GLM-5.2 结构 4.7 全场第一,正文 55.0。 这两个模型都很会做前期,到了正文却都被编辑评价为「不像网文」。
文件写得最少,正文反而第一
GPT-5.4 三轮只落盘 7 个文件(策划总纲 + 前 20 章提纲 + 正文),章纲覆盖率全场最低(1/3), 正文却拿到 75 分,三次只差 4 分。在这 54 次运行里,文件多少和正文好坏几乎没关系。
Hy3、DeepSeek V4 Flash、Step 3.7 Flash、Mimo 2.5 Pro 测试过程中,引导分未被记录,雷达图暂时按 0 绘制。
同样的输入,跑三次会差多少
每个点代表一次真人盲评分,横条是三次成绩的跨度,竖线是平均分。最稳的三次只差 4 分, 最不稳的差了 35 分。把鼠标移到点上可以看每次的分数。
只有四个模型能把分差压在 6 分内
GPT-5.4 差 4 分,Grok 4.5 和 Qwen3.7 Plus 都差 5 分,Kimi K2.6 差 6 分。 不过稳定不等于好用。GPT-5.4 是高分且稳定,另外几个稳定在中低分段。
偶尔写得好,和每次都写得好,是两回事
DeepSeek V4 Pro 拿到过全场单篇最高的 70 分,也跌到过 35 分,极差 35 分为全场最大。 用这类模型最好一次多写几版再挑,不能指望每次直接交稿。
写作方面还真不是越贵的模型越好
横轴是每次运行的账单,纵轴是真人盲评均分。要是越贵就越好,这些点应该大致排成一条斜线,但事实并非如此。
这里算的是首章完整流程的实付金额,包含 Plan 阶段的策划消耗,不只是写正文的 token 费。 按章节数直接相乘只能粗略估预算,因为续写时不必每章重做一遍策划。
便宜的模型也能写到 60 分以上了
Hy3(¥0.27/轮,61.7 分)与 Step 3.7 Flash(¥0.42/轮,63.3 分)把低价档的正文上限抬到 63 分, 和 Gemini(63.0 分,¥2.18/轮)处在同一档,费用只有它的 1/8 到 1/5。 如果要批量生产标准化初稿,海外模型已经没有明显的性价比优势。
token 花得多,不代表正文分更高
Grok 4.5 每轮 97.3 万 token 是 Hy3(22.5 万)的 4.3 倍,真人分反而低 8.4 分。 单价接近时,模型一次会用掉多少 token,更影响长期成本。这 18 个模型都符合这个情况。
国产模型表现出较高的写作性价比。但新的旗舰模型单价也在逐渐提升:国产平价组 ¥0.07 至 ¥0.13,国产贵价组 ¥0.29 至 ¥0.41, 新旗舰组 ¥0.41 至 ¥1.09,海外组 ¥1.06 至 ¥2.64。Kimi K3 的 ¥1.09 已经高过 Gemini 的 ¥1.06。
又快又稳又好才是真的好
全场 54 轮中 15/18 个模型零错误。 随时模型不断迭代,工具兼容的问题比早期少了很多。现在更值得看的,是模型能不能稳定高效完成任务。
标「约」的是区间估计。LongCat 2.0 有一轮超过 26 分钟仍未完成,没有可比完成时间。
跑完 54 轮,我们记下了这四件事
换了模型、换了批次,下面这些现象也还是反复出现。
四项能力不是一回事
Step 3.7 Flash 结构分与遵从分双双垫底,正文却是全场第二;Mimo 2.5 Pro 结构与遵从都在可圈可点,但正文垫底。 所以要按具体环节选模型,不能只认一个总冠军。
稳定输出还是偶尔惊艳
只有四个模型能把三次分差控制在 6 分内。DeepSeek V4 Pro(35)、Kimi K3(17)、Doubao(15)都写出过高分稿, 但下一次未必还能写出来,最好一次生成多版再挑。
照着大纲写,也可能不好看
Qwen3.7 Max 遵从 4.77 却被评「没冲突」,Qwen 3.8 遵从全场最低 3.17 正文却在中游。 遵从分高只能说明它按设计写完了,不能保证设计本身有意思。
模型往往急于快速传递信息量
18 个模型里,有 8 个主要因为把后面几章的内容提前塞进第一章而扣分。开篇节奏被打乱,第二章也没东西可写。
所有模型测评数据一览
在明细表中点击表头可以进行排序。
引导分标 N/A 的四个模型是 Plan 对话未保留、覆盖率 0/3;遵从分带 * 的是章纲覆盖率不足 3/3, 均分只按可评分轮次计算,置信度低于全覆盖模型。
54 轮运行生产出的作品详情在这里查看
如果现在就要选,可以这样搭配
策划和正文分开选,通常比让一个模型从头包到尾更合适。
策划与前期
共创与世界观
优先用 Sonnet 5。预算有限时可换 GLM-5.2 或 Kimi K3。K3 文件最全,也最慢、最贵,更适合一次把小说设定库搭好。
需求模糊、要「建议即约束」
平价档可用 DeepSeek V4 Pro。
连载资料、伏笔与索引
优先用 Qwen3.7 Max。预算很紧时可以用 DeepSeek V4 Flash,每轮 ¥0.29,整理出来的文件最完整。
正文生产
重点章节(黄金三章、卷末、大高潮)
优先用 GPT-5.4。预算有限时可让 Step 3.7 Flash 一次写几版再挑,同时复核事实、人物关系和章节边界。
铺量与方向验证
可以用 Hy3,每轮 ¥0.27。提示词里要写清最低篇幅、完整冲突和结尾钩子,否则它容易把第一章写得太短,像是还没写完。
无人值守的批量初稿
可以用 Qwen 3.8,三次测试都能自己跑完。交稿前仍要检查历史年份、人物年龄、季节是否一致,以及有没有夹杂英文。
我们建议养成好的写作习惯
1 · 先写章纲
Plan 阶段先充分沟通设计,把章纲保存下来。
2 · 按章纲写
Act 阶段只根据已经写好的章纲写正文。
3 · 修结构,再改文字
若需调整,先修改设计框架和章纲,再重写正文,而不是反复改正文。
4 · 别抢后面的戏
通过硬约束,不允许模型越界将后续章节的情节,提前写进章节。
换模型前,先把前面的关键信息总结到 soloent.md,再开新窗口。
别过度依赖模型,人很重要!
编辑对正文的批评主要集中在三点:爱升华、爽点不够、不像网文。 目前没有哪个模型的正文可以不经编辑直接交付,作者的个人风格和判断仍然至关重要。
这份测评是怎么做的
分数怎么来的,哪些地方不能过度解读,都写在这里。
怎么测的
统一输入
同一条提示词(穿越闰土修炼国术)、同一套补充条件(100 万字 / 传统国术 / 魂穿 / 热血爽文 / 清末民初)、同一流程:Plan → 补充条件 → Act → 首章落盘即停。
人和机器各评什么
五组首章都由真人编辑盲评,按百分制打分。采用 GPT5.6 负责有据可查的非盲评分。五组使用同一套评估框架:四项能力、三项引导标准和五项章纲遵从标准。
费用怎么算
费用都取 SoloEnt 后台实付。原平价组用灵蟹折扣价(2.5 至 5 折),原贵价组和海外组用平台实际计费,新增两批的美元实付按 ¥6.80/$ 换算。
单价、消耗和账单要分开看
单价说明模型本身贵不贵,每轮消耗说明它用 token 是否克制,账单是两者相乘的结果。账单适合估预算,不能单独代表效率。
必须客观看待的设计缺陷
样本量与题材单一
每个模型只跑了 3 次,而且都写清末国术爽文。换成都市、悬疑或其他题材,结果可能不同。
评的是完整工作流,不是纯文笔
每个模型都根据自己的大纲写正文,所以这里评的是整套流程的产出,不是把同一份大纲交给不同模型比文笔。
跨批次只能看大致档位
由于模型较多,我们分了五批,盲评的时间不同,编辑也可能不同,个位数分差不能当成可靠胜负。机器评分不是盲评,但最后两个批次略有调整。
有些资料缺失
补充批次没有保存完整的 Plan 对话,所以不评价它们的引导能力。Kimi K3、Hy3、GPT-5.4、Doubao、MiniMax 和 LongCat 也不是三次都有可评分的章纲。
附录:数据误差和接下来要补的测试
费用数据有哪些误差
- 新增两批统一按 ¥6.80/$ 换算,但各批折扣不同(Kimi K3 九折、Qwen 3.8 四折、Grok 没有折扣记录),横向比较单价时会有误差。
- 成本表没有拆分输入、输出和缓存 token,因此无法只靠目录价重新计算。
其他需要注意的地方
- 首章长度差得很大,从 Hy3 平均 1,927 字符到 Step 3.7 Flash 平均 5,866 字符。有些文件可能带自检、小结或合并了多章,字数不能直接代表质量。
- Step 3.7 Flash 第 1 次运行中途丢失了事件流,看不到中间交互和错误,所以「零错误」只是目前能确认的记录。
- 旧版 MiMo 与 Mimo 2.5 Pro 为不同版本样本,三轮成功只说明旧问题未复现。
后续计划
- 重测补充批次,并完整保存 Plan 对话和统一追问的答案,把引导评分补上。
- 用都市、玄幻、悬疑三种题材对比 Kimi K3 / K2.6、DeepSeek V4 Flash / Pro,看看新版本正文没变好是不是只发生在国术题材。
- 单独测试哪些过程文件真的能改善正文,重点对比每轮约 97 万 token 的 Grok 4.5 和约 22 万 token 的 Hy3。
- 增加更多盲评编辑,并且不让编辑看到模型名、文件结构和价格。
下一期想看什么测评?
想测哪种题材、哪个模型,或者工作流里的哪个环节,都可以写下来。