AI模型介入投资决策,正在从极客圈的实验演变为普通投资者的日常工具。DeepSeek作为国产开源大模型的代表,凭借低门槛的API调用成本和较强的逻辑推理能力,吸引了大量用户尝试用其构建选股策略。但一个关键问题随之浮现:当对话式AI被赋予真金白银的决策权重时,它的判断边界到底在哪里?本文通过三个月、四个不同市场环境下的连续跟踪测评,试图还原DeepSeek在选股场景中的真实表现,而非讨论其技术参数或跑分结果。
1. 测评方法:从指令设计到回测框架的完整搭建
为了尽可能排除偶然因素,测评没有采用单一的“问一只股票涨不涨”这种粗放模式,而是设计了一套分层指令体系。第一层是基础数据筛选,要求DeepSeek基于净资产收益率、毛利率、负债率等财务硬指标,在特定行业池内进行排序;第二层是市场情绪判断,输入近五日的量价数据与板块资金流向,让其输出短线风险评级;第三层是组合构建,要求模型在给定风险预算下,分配不同标的的权重比例。整个过程中,所有输入数据均采用截至测评日前一个交易日收盘的公开信息,且不包含任何未来函数。
回测框架选择了A股市场中波动特征差异显著的三类标的:沪深300成分股中的大盘蓝筹、中证500中的中盘成长股,以及科创板中高波动的科技股。每个类别各取20只股票构成模拟池,测评周期为2025年1月至3月。为了防止DeepSeek因对话上下文过长而产生遗忘或漂移,每次提问前都会将指令模板重置,并规定输出格式必须包含明确的买入、持有或回避结论,以及不超过150字的理由陈述。值得强调的是,所有决策指令均未要求模型预测具体点位或目标价,而是聚焦于相对强弱判断和风险事件识别。
在数据校准方面,测评团队将DeepSeek的输出结果与同期的传统量化因子模型(如Fama-French三因子模型)进行了横向对比。这套方法论的核心价值在于,它区分了模型的信息提取能力与真实决策能力——前者反映的是AI能否从海量数据中识别出有效信号,后者则取决于信号到操作之间能否构建稳定的映射关系。实际执行中,每组指令会连续运行三次,取置信度最高的输出作为最终决策参考,这在一定程度上压缩了模型生成随机性的影响。
2. 实战表现:不同市场环境下的胜率与决策质量拆解
在整个测评区间内,DeepSeek共发出87次有效选股信号,其中买入信号34次,持有信号28次,回避信号25次。从整体胜率看,以发出信号后10个交易日内的最大涨幅是否跑赢所属指数为判定标准,买入信号的胜率为58.8%,虽然高于随机选择的预期水平,但并未表现出碾压性的超额优势。值得注意的是,模型在下跌趋势中的防御能力明显优于上涨趋势中的进攻能力。当沪深300指数在2月中旬出现连续三周回调时,DeepSeek给出的回避信号命中率达到了76%,这一表现显著优于同期多数主观型散户的决策。
在具体的个股案例中,有一支样本值得深入拆解。2月10日,模型对某半导体设备公司给出了买入评级,理由是当时市盈率处于历史分位的12%,且资金流向指标连续四日净流入,叠加国产替代政策窗口期。该股随后在12个交易日内上涨了约19%,表现优异。但仅隔一周,模型在另一支同板块个股上给出了类似逻辑的买入信号,却遭遇了业绩预告暴雷,股价在5个交易日内跌去14%。对比这两组决策不难发现,DeepSeek在显性数据推演上具备较强的条理性,但对于非结构化信息(如管理层语调变化、供应链突发事件)的响应存在明显迟滞。
更进一步看模型在不同市场风格下的适应性。在成长风格占优的阶段,DeepSeek选出的标的平均跑赢中证500指数2.3个百分点;而在价值风格占优的时期,其超额收益仅为0.7个百分点。这种差异说明,模型的训练语料中关于高估值容忍度、技术迭代叙事的理解较为丰富,但面对低估值修复、高股息策略等传统逻辑时,其输出的结论往往偏向教科书化。换句话说,DeepSeek更像是一个记忆力极佳的宏观分析师,而非拥有丰富交易直觉的基金经理。
3. 隐性缺陷与风险误判:那些模型看不到的盲区
测评中暴露出的最核心问题,并非模型算错数据,而是其逻辑链条中存在固化的归纳偏差。一次典型的案例发生在对某消费白马股的评估中。DeepSeek依据连续八个季度的营收增速和稳定的现金流给出了持有评级,但忽略了渠道库存周转天数已连续三个月上升这一前置指标。这种对滞后数据的依赖,源于模型训练语料中财经资讯和研报的更新频率天然低于市场高频交易数据。当模型被问及“是否有未反映的风险”时,其固有回复模式倾向于基于年报、公告等格式化信息进行检索,而缺乏对产业链上下游实时反馈的感知能力。
另一个高频风险集中在停牌与流动性判断上。3月有一组信号,模型对某小市值公司给出了“积极关注”的建议,理由包括市净率低于行业平均水平且出现主力资金尾盘抢筹迹象。然而,模型未能有效识别该公司在两周后因筹划重大资产重组而停牌,期间大盘全行业平均跌幅达4.8%,复牌后该股虽然因重组成功出现上涨,但整个持有期的资金成本与机会成本被大幅低估。这个案例折射出一个更深层的问题:DeepSeek在给定信息边界内表现优异,但面对动态博弈中的制度性风险(如停牌审查、股东减持新规),其输出结果难以构成可执行的交易策略基础。
还有一类隐性缺陷值得特别提示,即模型面对高度相似的输入模式时,容易产生逻辑闭环的自我强化。测评中设置了一组具有相反基本面走向的双子测试——两家同行公司,一家正遭遇核心产品价格战,另一家则受益于同类型产品涨价。当输入数据中价格信息占比过高时,DeepSeek倾向于用统一的“供需关系”框架给出结论,但在区分成本传导能力与终端议价权差异时,其推理深度明显不足。因此,测评后期开始将模型输出的“确定性表述”进行概率化修正,才勉强降低了误判率。
4. 使用边界与辅助定位:如何将AI信号纳入有效决策流程
连续跟踪的数据显示,DeepSeek选股能力的有效发挥依赖一个核心前提:输入数据的充分结构化与非情绪化。当将财报附注中的关键细节、股东结构变化、大宗交易折价率这类低频但高权重信息整理成表格文本输入时,模型的判断准确率可提升近十个百分点。相反,若直接抛入一段新闻通稿或股吧热帖,其输出往往被情绪化措辞带偏。这决定了它更适合作为投研流程中的数据预处理器和逻辑校验器,而不是独立决策引擎。
从实际操作层面看,配备AI选股辅助的投资者,应当主动构建三层过滤机制。第一层,用传统量化指标池剔除明显高估或财务瑕疵标的;第二层,将DeepSeek输出的分析结论作为第二意见输入,重点比对其对风险提示项的覆盖程度是否完整;第三层,结合自身的仓位管理与止损纪律,将模型的“高置信度”信号降级为“可关注的候选池”。这种定位能够最大程度规避模型在低流动性陷阱和事件驱动型机会上的结构性缺陷。
就测评结果而言,DeepSeek在信息检索、财务逻辑梳理和静态风险评估方面具备超出预期的可用性,但它无法替代投资者对市场生态的感知能力。任何试图将选股决策完全外包给AI的做法,本质上是对概率思维与责任边界的误读。真正可靠的做法,是将AI视为一名知识广博但缺乏实时坐标的顾问——它负责提供详细的作战地图,而跨越壕沟与雷区的动作,始终需要人来完成。