画图能力正在成为衡量AI助手实用性的关键标尺。自2024年生成式AI大规模落地以来,用户对文本对话的耐心迅速消退,真正能引发传播和付费的,往往是那张一眼可见的图。DeepSeek作为国产开源大模型中的代表性选手,其文本推理能力有口皆碑,但当任务切换为“画一张图”时,它交出的答卷究竟能否匹配“全能助手”的预期,仍是个悬而未决的问题。本文不打算停留在参数对比或厂商宣传层面,而是直接以实际任务切入,从文生图的指令遵循、视觉理解与编辑、风格迁移表现以及复杂场景逻辑构建四个维度,逐项拆解DeepSeek在真实使用中的成色,以期为正在选型AI工具的创作者和职场人提供一份扎实的参考。
1. 文生图指令遵循:精确与模糊之间的博弈
文生图的第一个门槛不在于模型能画得多精致,而在于它是否听懂人话。实测中,DeepSeek对包含明确主体、具体动作和限定场景的指令处理得相当稳健。例如,输入“一只戴着红色围巾的柴犬坐在咖啡馆窗边,桌上放着一杯拿铁,窗外下着雨”,模型能够在单次生成中准确还原所有元素,没有出现主体丢失或属性错配的问题。这种表现在国产模型中属于中上水准,尤其是在对“围巾颜色”“坐姿朝向”“雨滴状态”这类修饰语的绑定上,显示出其语言编码器对视觉属性与空间关系的对齐能力经过了充分调校。
然而,当指令从精确转向模糊或抽象时,DeepSeek的短板便暴露出来。所谓“很有氛围感的夜晚”这类描述,模型倾向于输出一张泛着蓝紫色调、带光斑的普通夜景,缺乏对“氛围”语义的深度解构。更值得留意的是,面对带有否定词的指令,例如“画面中不要出现任何文字”,模型偶尔仍会在角落生成无意义的LOGO状色块。这并非DeepSeek独有,但反映出其指令遵循机制更适应正向外延式描述,对蕴含逻辑否定的语义粒度处理还不够细腻。从业者如果依赖其进行商业出图,在需求文档中须将模糊词转化为可量化的视觉语言,例如将“氛围感”拆解为“低光源、高对比、暖色调”。这一环节的实测结论是,DeepSeek可以充当高效的执行者,但尚难胜任模糊需求的澄清者。
2. 视觉理解与编辑:基础能力扎实,高阶操作仍欠火候
严格来说,DeepSeek并非纯粹的文生图工具,它还具备图生图及视觉问答能力。在实测中,上传一张包含多个物体的产品照片,并指令其“将背景中的木桌换成大理石纹理,保持产品本身不变”,模型对前景与背景的切割较为准确,纹理替换后的光影过渡也未见明显破绽。这说明其视觉编码器对图像语义层次的理解不是浅层的像素级复制,而是基于物体边界的高层认知。对于日常修图、电商素材微调这类高频需求,这一能力已具备实际生产力。
但一旦涉及基于精确位置或数量关系的编辑操作,表现就变得起伏不定。例如,给出“将画面中左边第二个人物的帽子变成蓝色”这一指令时,模型在部分样例中能正确定位目标,在另一些样例中却会把帽子颜色错误地应用到相邻人物身上。这种空间指向性的不稳定,源于其视觉特征与文本坐标之间未建立强对齐关系。相比之下,在涉及面部表情微调、光线方向调整这类全局属性编辑的场景中,DeepSeek的完成度反而更高,说明其优势在于整体氛围迁移而非局部特征锚定。对于需要高精度点位操作的UI设计或摄影后期,用户仍须借助传统图像处理软件手动辅助,AI助手在其中更多扮演效率提升加速器而非替代者的角色。
3. 风格迁移与艺术表现:风格融合亮眼,原创性受限
风格迁移是检验AI审美能力的试金石。实测选用了几组差异明显的风格标签:水墨画、赛博朋克、浮世绘以及上世纪80年代复古海报。DeepSeek在单一风格模仿中表现令人惊喜,尤其是水墨画与浮世绘两条路径,其对笔触的干湿浓淡变化、留白构图以及线条的顿挫感把控,已经具备相当高的仿真度。以浮世绘为例,生成的画面虽然由AI产出,却带有葛饰北斋式的海浪形态与版画印刷的颗粒质感,视觉完成度远超同量级开源模型。
更值得探讨的是多风格混合指令,例如“在一张赛博朋克风格的街道上融入水墨画的远山”。DeepSeek在处理此类需求时展现出不错的调和能力,并未简单地将两种风格元素生硬拼接,而是通过调整饱和度与边缘处理,让霓虹灯光呈现出类似墨色晕染的弥散感。这种融合性的风格转译,体现了模型在特征空间中对不同风格域的隐性解耦能力。但与此同时,其原创性天花板也较为明显——当要求其创造一种“从未出现过的画风”时,模型输出的结果仍然带有浓重的既有流派痕迹,本质上是对已有风格的重新排列组合。对于艺术创作者而言,DeepSeek更接近一位技艺娴熟的临摹者,能够在既定范式内高效执行,却难以成为风格定义的拓荒者。
4. 复杂场景逻辑构建:叙事连贯性尚可,物理规则易崩塌
当画面中需要同时呈现多个互动对象、空间层次以及时间顺序时,复杂场景构建能力便成为核心考验。实测设计了一个日常但逻辑链完整的任务:“一位母亲在厨房做饭,小孩在餐桌旁写作业,窗外一只猫正跳上围墙。”DeepSeek生成的画面在元素齐全度上达标,人物朝向、场景分区以及前景与背景的透视关系均大致合理,叙事逻辑能够被清晰识别。这说明模型具备一定的场景脚本编排能力,能够将独立的语义单元组织成一个协调的叙事整体。
问题集中出现在物理规律的表达上。在上述测试中,模型将“猫跳上围墙”的动态过程呈现为已完成的静止状态,猫的四肢姿态却呈现明显的人类认知偏差,后腿反关节扭转,且影子方向与窗户透入的光线不一致。这种对非刚性物体运动规律和光影一致性的误判,在多个测试用例中反复出现。它揭示了DeepSeek对空间关系的理解仍是基于大量图像数据的统计关联,而非建立在对真实物理世界的因果模拟之上。更严峻的挑战出现在多物体遮挡与相对大小关系上,例如要求“一只猫站在大象后面,只露出尾巴和头”,模型经常将“后面”错误表现为“旁边”,显示其三维深度感知在语言映射层面仍存在盲区。对于需要严格符合现实中透视和运动逻辑的插图、概念设定图,人工纠错仍是不可省略的工序。

