80后创业者带领团队以不足业内巨头十分之一的研发成本,在半年内推出三款颠覆性AI大模型,其中一款数学推理能力直接对标OpenAI o1系列。这是中国AI圈近期最令人震动的消息,而故事的主角梁文锋,并非海归精英,也非硅谷辍学生,而是一位从广东湛江走出的本土技术极客,一位真正的80后。
从量化私募到通用人工智能,梁文锋的商业路径和研发哲学,正在重新定义中国AI竞争的底层逻辑。他执掌的DeepSeek,不融资、不烧钱、不搞流量营销,却靠着极致工程效率和独特人才观,在全球AI竞赛中撕开一道裂口。这位幕后操盘手的崛起,不仅是个人奋斗的样本,更是中国AI产业进入硬核技术深水区的一次集中显影。
1. 八十万启动资金的技术极客,如何穿越三次行业周期
2008年,梁文锋从浙江大学电子工程系硕士毕业,与几位同学凑了八十万元,在杭州租下一间民房,开始探索机器学习在量化交易中的落地。那是中国量化投资尚处于蛮荒期的阶段,市面上鲜有成熟的金融数据接口,更别提专门针对国内市场的算法模型。梁文锋没有选择加入当年如日中天的互联网大厂,也没有去海外镀金,而是带着团队自研交易系统,一步一步从高频交易的数据清洗做起。
这段经历淬炼出他对“工程效率”近乎偏执的追求。量化交易对延迟和误差的容忍度极低,任何一个策略回测框架的缺陷都可能导致实盘亏损。为了优化撮合引擎,梁文锋团队曾连续三个月修改底层代码,把单笔交易延迟从毫秒级压到微秒级,最终在当地私募圈站稳脚跟。2013年,他成立幻方量化,用AI模型替代传统统计模型来预测市场波动,这一决策比国内同行早了近五年。
2019年,幻方量化资管规模突破千亿元,跻身国内头部私募梯队。但梁文锋没有停留在舒适区,他开始思考一个更宏大的问题:如果AI能处理金融序列数据,那么它能否理解自然语言、数学逻辑和代码?2023年5月,他宣布进军通用人工智能,成立DeepSeek。从金融量化到AI大模型,表面看是赛道切换,但底层方法论一脉相承:用工程驱动的思路解决复杂系统的不可预测性,用极低的试错成本换取极致的产品迭代速度。
2. 不融资不烧钱,DeepSeek用三项工程创新改写AI研发成本结构
当硅谷巨头动辄投入数亿美元训练一个千亿参数大模型时,DeepSeek的研发预算显得寒酸至极。据公开信息,DeepSeek-V2的训练成本不到同等规模Llama-3的七分之一。这种成本优势并非来自偷工减料,而是源于三项关键的工程创新。
第一项创新是混合专家模型架构的深度优化。DeepSeek没有像GPT-4那样把所有参数都激活,而是将模型拆解为数百个专家子网络,每次推理仅调用其中少量专家模块。这种稀疏激活策略大幅降低了计算资源需求,同时通过独创的负载均衡损失函数,避免了传统MoE模型中专家塌缩问题。第二项创新是FP8混合精度训练框架的自主开发。国内大部分团队依赖英伟达的TensorRT或PyTorch原生库,而DeepSeek底层训练代码直接操作CUDA内核,把非核心层级的计算精度主动降级,从而在同等算力下提升近40%的吞吐效率。
第三项创新在于数据飞轮机制。DeepSeek没有走人工标注的海量数据路线,而是设计了一套自动化的数据质量过滤系统,利用小模型预筛低质语料,再用大模型自蒸馏生成高质量数学和代码数据。这套系统使DeepSeek在训练数据量减少一半的情况下,推理能力反而提升。梁文锋曾私下算过一笔账:如果完全复刻OpenAI的研发路径,DeepSeek需要至少4亿美元和两千人团队,但他用两千万元人民币和两百人团队做到了同等水平的数学推理能力。这在全球开源社区引发巨大震动,也让中国大模型企业看到了弯道超车的另一种可能。
3. 极客文化溢出行业边界:一份内部访谈录引发的AI圈用人革命
今年年初,一份DeepSeek内部访谈录在程序员社群疯传。梁文锋在访谈中直言:“我们不看重名校背景,也不看论文数量,只看动手解决真实问题的能力。”这句话戳中了许多中国AI从业者的痛点。长期以来,国内大厂AI团队以学历和顶会论文论英雄,导致大量天赋型工程师被卡在HR筛选之外。
DeepSeek的招聘逻辑彻底颠覆了这一潜规则。团队成员中既有清华计算机博士,也有毕业于普通二本院校、但拥有五年量化交易实战经验的系统架构师。梁文锋专门设立了一个“算法擂台”,候选人需要在72小时内完成一个真实业务场景的模型调优任务,而非传统的一小时面试问答。这种选拔筛选出的工程师极擅长在资源受限条件下做出高性能方案,而这恰恰是大模型军备竞赛中最稀缺的能力。
这种用人文化正在产生外溢效应。国内多家AI创业公司开始效仿DeepSeek的擂台赛模式,连一些头部大厂也调整了算法工程师的考核标准,不再单纯以论文数量作为晋升依据。梁文锋用亲身经历证明,中国本土工程师的创造力并不逊色于硅谷,关键在于企业是否愿意打破学历迷信和资历崇拜。在DeepSeek内部,他甚至取消了固定职级体系,所有工程师按季度项目贡献重新评级,这种激进的组织设计在保守的中国科技行业堪称异类。
4. 开源生态战略与中国AI竞争格局的下一步棋
当OpenAI、Google选择闭源并商业化API时,DeepSeek却反其道而行,将核心模型权重全部开源。梁文锋的逻辑很清晰:闭源模型终将被开源模型超越,因为开源社区的集体智慧迭代速度远快于任何单个公司。这一判断已在DeepSeek-V2上得到验证,其代码生成能力在开源贡献者的反馈中持续提升,部分指标甚至反超了同期的闭源商业模型。
开源战略背后是梁文锋对中国AI产业话语权的深层思考。他曾在多个场合强调,中国AI不能总是在别人的底座上建房子,必须掌握底层架构的自主权。DeepSeek一直积极参与国产算力生态适配,其模型在华为昇腾芯片上的运行效率已达到英伟达A100的85%,这个数据远超行业平均的60%。一旦未来国际形势导致高端芯片断供,DeepSeek的技术储备将是中国AI安全的重要压舱石。
而梁文锋的野心不止于模型层。他正推动DeepSeek与多个垂直行业合作,包括金融风控、生物医药分子生成、工业流程优化等。在他看来,大模型的终局不是聊天机器人,而是成为像电力一样的通用基础设施。这位80后操盘手的每一步都显得克制而精准,不追逐热点、不迷信西方范式,用工程理性构建自己的技术信仰。DeepSeek的崛起或许只是一个开始,当越来越多中国本土培养的80后、90后技术人才敢于挑战既定规则,中国AI的真正突围才会全面到来。

