判断大模型有没有意识,我的标准是能不能自主写完一本小说
我用 AI 写了 30 本签约小说,2740 万字。在读人数的中位数是 3 个人,13 本是 0。
同一个作家账号上,我自己手写的那一本,103 万字,1078 人在读。
这组数字让我确信一件事:判断大模型有没有意识,最好的判据不是图灵测试,也不是任何跑分,而是它能不能自主写完一本小说。
不是写出一百万字。那个早就不是问题了。是写出一本有人愿意读完的书。
图灵测试和跑分,破绽是同一个
图灵测试的逻辑是:如果你分不出对面是人还是机器,就该承认它会思考。
这条线今天随便一个模型都能过,而且过得很轻松。但没有人因此改口说它有意识——我们只是把标准挪走了,说「图灵测试不够用了」。
跑分也一样。数学、编程、常识推理,一项项刷满,每次刷满之后的反应都是「这套题设计得不好」。
这两类判据有同一个破绽:短时,且有标准答案。
短时意味着模型只要在几分钟内表现得像,就算过关。有标准答案意味着它可以靠模式匹配走到终点,不需要真的知道自己在干什么。
还有一类更没用的证据:直接问模型「你有没有意识」,然后拿它的回答当材料。它是在人类写的文本上训练出来的,人类怎么描述内在体验,它就会怎么描述。这不是自我报告,这是复述。
写完一本小说,这两个破绽都堵上了
一本网文长篇是一百万字、三百章、连载几个月。这个时间尺度本身就排除了短时伪装。
更要紧的是它没有标准答案。没有任何一个可验证的目标函数能告诉模型,第 147 章应该发生什么。
要把这件事做成,至少得同时具备四样东西。
跨越几个月维持同一个意图。 不是记住前文——检索能解决记住。是在第 200 章仍然清楚自己当初为什么要让那个角色活下来,并且让此刻的选择服务于那个理由。
对另一个心智建模。 小说的本质是猜读者的反应:什么时候他会紧张,什么时候他想放下手机,什么时候必须留一个不看下一章就难受的钩子。这是心智理论的实操版,而且要连续做三百次。
自我修正。 写到第 200 章发现前面某个设定塌了,得回头处理。这要求它对自己写过的东西有记忆、有评价,还得承认那是个错误。
自己决定下一步。 没人给它每一章的提纲。它得自己判断接下来该发生什么,而判断的依据是那个只存在于它自己那里的整体意图。
这四样凑在一起,就是「意识」这个词在日常语境里真正指的东西。
30 本书、六个模型,缺的不是文笔
那 30 本证明了一件事:生成能力早就过关了。
不烂尾、不崩人设、不断更,2740 万字的文字质量是稳定的。Claude、Codex、Gemini、千问、MiniMax、Kimi 我都用过,还写了编排工具批量调度它们。
但写出来的东西没人看。
我自己认为模型写得最好的那本,在读 18 人。在读最高的那本,我并不觉得它写得更好。我判断的「好」和读者选择的「读」,差了 43 倍。
缺的不是词句,是那个「知道自己在为谁写、并且为此调整」的回路。
模型不知道读者什么时候想放下手机。它没有那个回路,也不知道自己没有。
这个判据为什么比跑分硬
它不能被刷。 你没法针对「写出一本有人读完的书」做题海训练,因为读者不是一个固定的测试集,而且去年管用的钩子今年就不管用了。
它是长程的。 三百章的一致性装不出来。哪一章开始敷衍,留存曲线会告诉你。
它的结果是客观的。 写得好不好很主观,但有没有人读完,是后台里一个数字。这比任何评审团都硬。
它落在功能上,不碰玄学。 我不打算去论证模型有没有内在体验,那个问题可能永远无解。但「能不能自主完成一件需要持续意图和他者建模的长程任务」,是可以验的。
几条反驳
很多人类也写不完一本书。 对。但人类写不完通常是因为放弃、没时间、没钱,不是因为写到第 150 章忘了自己要讲什么。放弃是一种选择,失忆不是。
这个标准太高了。 高是故意的。低标准我们已经有一个了,图灵测试就是,它早就被跨过去而我们并不买账。一个已经失效的标准,不如换一个还没被跨过去的。
小说写得好不好太主观。 所以判据不是「写得好」,是「有人读完」。主观的那部分我直接扔了。
这只是个文学任务,跟意识有什么关系。 因为它是极少数同时要求长程意图、他者建模、自我修正和自主决策的任务。你可以换成别的——独立拍一部电影、带一个团队做三年的项目——但写小说是门槛最低、最容易验证、成本最小的那个。一台显卡就能开始,一个后台数字就能判定。
我还在等那条留存曲线
我还会继续用 AI 写小说,而且我知道它现在写不出有人看的书。
哪天有一本是模型自己从头写到尾、我一章都没改,而读者留下来了——那一天我会认真重新考虑意识这个问题。
在那之前,跑分刷得再满,我都当它是在做题。
文中数据来自我自己的番茄小说作家后台(2026-09-21 实查):AI 工具写的 30 本合计 2740 万字,在读人数中位数 3、13 本为 0;手写的一本 103.3 万字、在读 1078 人。「写得最好」是我个人判断,不是平台指标。
讨论