文章详情

大语言模型进入中文创作领域已三年有余,从早期只能拼贴碎片化意象,到如今能够输出完整的中长篇叙事文本,AI写作能力的进化速度远超多数从业者的预期。DeepSeek作为开源模型阵营中备受关注的一员,其在小说生成方面的实际表现究竟处于什么水平,值得一次系统性的检验。本文以“AI写小说能力实测”为切入点,围绕DeepSeek在故事架构、角色塑造、语言风格与情感逻辑四个维度的生成效果展开分析,并结合编辑视角的审查流程,评估其创作文本距离可发表水准还有多远。这一测试的意义不在于简单地评判“像不像人写的”,而在于厘清当下AI文学创作的真实边界。

1. 叙事架构生成:从因果链搭建到冲突节奏的自觉

对小说创作而言,故事框架的完整性是衡量AI叙事能力的首要指标。DeepSeek在接收到“写一个关于时间循环的悬疑故事”这类指令时,能够迅速生成包含开端、发展、高潮、结尾的完整情节线。模型内部经过海量文学语料训练所形成的结构认知,使其在起承转合的安排上具备了基本的人类叙事直觉。实测中,DeepSeek设计的循环机制并非简单复制经典影视作品的设定,而是会主动引入“记忆残留”和“时间锚点”等补充规则,使循环逻辑在文本内部自洽。这种对设定细节的自觉补全,显示出模型已经跳出纯粹模仿的层面,具备了粗浅的创造性重组能力。

冲突节奏的控制则更能体现模型对叙事本质的理解程度。在生成一个中篇体量(约两万字)的犯罪小说大纲时,DeepSeek会将案件线索的释放节点分布得较为均匀,在每三千字左右设置一个明确的悬念转折点,同时避免在后续展开中频繁推翻前文逻辑。它还会主动调整章节之间的信息落差,确保读者在获得部分解答后仍有新的疑问产生。这种对信息释放顺序的把握,意味着模型并非简单地通过关键词拼接来完成故事,而是形成了一个具有因果约束力的内部叙事模型。

不过,结构上的成熟并不代表深层叙事动机的可靠。实测中,DeepSeek在情节推向高潮时容易出现“机械降神”式的解决方案,即让关键角色在最后一刻突然获得此前从未铺垫的能力或资源。这种处理暴露出模型在长程因果推理上的短板——它更擅长在短距离内维护叙事逻辑,却难以在整体篇幅内持续埋设伏笔并保证每一条线索都得到合理解答。

2. 人物弧光塑造:动机生成的内在矛盾

DeepSeek编故事,AI写小说能力实测

人物的立体程度是区分“故事”与“小说”的关键标尺。DeepSeek在塑造人物时展现了两种截然不同的状态:当指令只要求“描写一个性格古怪的侦探”时,模型输出的往往是一堆标签化的形容词堆砌——偏执、孤僻、天才、有强迫症——这些关键词在文本中反复出现,却缺乏具体的场景支撑。但如果指令中嵌入了人物驱动情节的明确要求,比如“一个害怕水的记者被派往海岛采访命案”,DeepSeek的表现则有明显提升。它会将人物的恐惧心理层层拆解,从初到海岛时的不安,到被迫靠近海边时的生理抗拒,再到最终克服恐惧直面真相,人物的行为轨迹与心理变化在叙事中形成了可被精确追踪的弧光。

深层的角色动机构建在实测中呈现出一种有趣的模式——模型往往倾向于将复杂动机简化为单一化的童年创伤或原生家庭阴影。这背后的原因不难理解,训练语料中大量通俗文学和影视剧本都采用了这一叙事捷径,使模型在概率分布上形成了强烈的偏好。当被追问具体心理机制时,DeepSeek能够从创伤事件本身延伸出行为表征,比如“因为目睹过溺水,所以每次听到流水声都会下意识屏住呼吸”,但很难再进一步挖掘创伤背后的社会关系、道德困境或自我认知问题。这意味着AI生成的角色普遍缺乏心理学意义上的多重决定因素。

对话语言也是人物塑造的重要维度。DeepSeek生成的人物对话在口语化层面表现尚可,能够区分不同年龄和职业群体的用词习惯,但在语气连续性和副语言信息的承继上存在明显断层。同一个角色在连续两句对话中,极易从充满市井气息的粗粝口吻跳到书面感极强的书面表达。这种语域切换打破了读者的沉浸感,也反映出模型在长文本中保持一致角色语言特征的能力仍不稳定。

3. 语言质感调配:文学性修辞与叙事效率的博弈

文学语言的特殊性在于,它不仅要传递信息,更要在信息传递的过程中制造审美体验。DeepSeek在收到带有明确文学风格要求的指令时,比如“用王小波式的话语写一段都市奇遇”或“以张爱玲笔触呈现上海细枝末节的生活”,能够通过模仿句式结构和修辞手法,做到表层风格的高度近似。这种模仿力在句群层面表现突出——比喻的构造、排比的铺陈、节奏的张弛——都能在数十个句子中维持稳定的风格特征。而这些语言层面的技巧,恰恰是两年前同类型开源模型最为薄弱的环节。

DeepSeek编故事,AI写小说能力实测

但语言风格的保持一旦跨过五千字,就会出现肉眼可见的衰减现象。模型前期的精心打磨和中后期的语言松散形成强烈对比,前文本中密集的意象呼应在后文逐渐消失,叙述开始简单化地平铺直叙,人物的动作描写和心理活动也不再具有前期的细节密度。这并非单纯的模型遗忘问题,而是生成过程中上下文窗口对风格约束的吸引力逐渐被庞大信息量稀释。与人类作家在创作中后期依靠自我控制力维持文风不同,AI的语言风格维持完全依赖输入指令的强度,一旦初始指令中风格权重不够突出,衰减速度会更快。

修辞细节的“堆叠倾向”也是DeepSeek常见问题之一。模型倾向于在一个场景节点中塞入大量感官描写和环境细节,试图通过数量上的铺陈达到文学效果。然而这些细节之间往往缺乏有机联系,出现“窗外飘过一阵玉兰花香,铁皮雨棚上的积水顺着缺口滴落,楼道里传来老头持续的咳嗽声,桌上的搪瓷杯内壁蒙着茶渍”这类把听觉、嗅觉、视觉、触觉机械叠加的段落。这些排铺场景对于推进情节、塑造氛围、揭示性格都没有实际支撑,呈现出模型对“文学性”的外部化理解。真正成熟的文学表达讲究以少胜多、强调整体融贯,而AI的生成仍停留在痕迹明显的加法美学。

4. 情感逻辑推演:虚构情绪的合理性与共情机制

虚构作品的情感表现是否令人信服,取决于人物的情绪反应能否在既定情境中找到合理的逻辑。DeepSeek在生成人际互动场景时,对常见情绪反应的推算达到了相当高的准确度。当指令要求写“一对结婚十年的夫妻在发现丈夫失业后的家庭对话”,模型输出的文本精确捕捉了双方那种欲言又止、互相试探又避免正面冲突的微妙状态。这种基于大量社会文本训练的推理能力,让AI在情感描写层面拥有了接近于经验作者的直觉反应,远非简单的情绪词汇拼接可比。

当情境变得复杂、涉及多重情感叠加时,模型的推理能力便出现明显短板。例如在描写“一个失去女儿的女人面对丈夫提出领养孤儿”的冲突场景时,DeepSeek生成的文本将悲痛和犹豫处理得过于单一,情绪在愤怒和哭泣之间跳动,却未能深入到更复杂的层面——那种因失去而珍视又因害怕再度失去而抗拒的心情,以及与丈夫之间因悲痛的差异而产生的隔阂。这种细腻的层次化情绪表达对AI而言仍是巨大挑战。

共情机制的构建牵涉一个深层的技术瓶颈——模型没有真实的生命体验。它的一切情感知识来自二手文本的标注和归纳,本质上是对情绪模式的统计学再现。测试中通过指令给出极度抽象的情绪状态(比如“一种不知道自己在悲伤的悲伤”),DeepSeek输出的文本只能说是在该字面描述周围的词汇聚类,无法进一步扩展出与这种情绪相匹配的场景细节和行为反应。诚然,当前以DeepSeek为代表的大语言模型在命题作文式的小说生成中已经够得上“初级写手”的门槛,但若要追踪人类情感复杂的暗流和那些难以名状的记忆瞬时,模型还有漫长的路要走。这并非贬低现阶段的AI潜力,而是严肃地指出,文学感知力的余裕,或许正是人类创作者尚能守住的那道最后的防线。