全部报告
每期测试重点有所不同。报告可查看测评结论和所有产出作品素材。
第 05 期
横向对比题材依赖章纲质量版本升级
2026.09.04
仙侠 / 脑洞 / 年代 三题材横评
仙侠、脑洞、年代三次正文测评,共 90 篇作品、306 份双盲评分。重点看模型有多挑题材,章纲会把正文拉开多大差距,以及版本升级和更贵的型号是否值得加钱。
3题材
16涉及模型
90匿名作品
306有效评分
第 04 期
正文写作年代文细节质感
2026.09.04
同一章纲写正文·年代题材
10 个模型用同一份章纲,各写三篇 1979 年北京背景的年代文开篇。双盲评分重点看总分、五项能力、年代细节、稳定性和成本,正文与评语全部公开。
10参评模型
30匿名作品
91有效评分
6评分维度
第 03 期
正文写作脑洞流双盲评分
2026.09.04
同一章纲写正文·脑洞题材
10 个模型用同一份真人章纲,各写三篇脑洞文开篇。双盲评分重点看总分、五项能力、AI 感、稳定性和成本,正文与评语全部公开。
10参评模型
30匿名作品
98有效评分
6评分维度
第 02 期
正文写作暗黑西游双盲评分
2026.08.10
同一章纲写正文·仙侠题材
仙侠题材,暗黑西游元素,主角穿越成龟丞相最不受宠的十三子。
大纲、章纲、人物设定完全一致,10 个模型各独立生成 3 篇正文第一章,真人评委双盲评分。含总榜、五维拆解、稳定性、成本分析与 AI 感解析,所有测试正文和章纲均可查阅。
10参评模型
30匿名作品
117有效评分
6评分维度
第 01 期
全流程清末国术编辑盲评
2026.07.07
从 Plan 开始的写作全流程测评
国术题材,清末国术,主角穿越成闰土,一路练拳。同一条提示词、同一套补充条件,18 个模型各跑三轮:Plan 引导 → 策划文件 → 章纲 → 第一章正文。把「写作能力」拆成引导互动、结构设计、执行遵从、正文创作四维分别打分,再叠上耗时与成本。四种能力彼此独立,没有全能冠军。
18参评模型
54运行轮次
53有效首章
4能力维度
我们怎么测
控制测试输入,机器自动采集,真人双盲参评,科学数据清洗。
1
统一输入
不同写作场景的测试,均保证有统一的输入,每个模型可独立生成多次结果,互不干扰。
2
真人盲评
写作效果无法完全依赖模型评分,真人对正文的评价更具参考价值。真人评分时不知道模型信息。
3
清洗后统计
科学剔除异常值,判别力不足的样本整批排除,再进行数据统计。样本量和数据口径完全透明。
点菜
下一期想看什么测评?
想看测评什么品类,什么模型,或什么写作场景,快告诉我们吧。