INDEX / NO.027 — 2026.08.02 — 人物

高能人物:DeepSeek 梁文锋与他的开源商业哲学

从 AGI 目标、年轻团队到开源选择,梁文锋把 DeepSeek 的长期优势押在持续创新上。

高能人物:DeepSeek 梁文锋与他的开源商业哲学

站在巨人的肩膀上

就在 2026 年 7 月 31 日,V4-Flash 正式版 API 上线公测,官方称其 Agent 能力大幅增强。

如果把模型权重和论文都公开,DeepSeek 的护城河还剩下什么?

DeepSeek 开放的不只是模型权重。我的理解是,这不是把单代模型的独占性当作核心护城河,而是把未来更多押在产生下一代创新的速度上。

DeepSeek 官网

图源:DeepSeek 官网

梁文锋在《暗涌》的采访中没有把答案放在专利或技术秘密上,而是放在团队里。他认为,研究者在研发中积累的 know-how,以及能够继续创新的组织和文化,才是更值得沉淀的价值。

这是理解梁文锋的一条重要线索。

一、从跟随者到贡献者

梁文锋 1985 年出生,先后在浙江大学完成电子信息工程本科和信息与通信工程硕士学习,读研时研究机器视觉。

2015 年,他与浙大校友共同创立幻方公司。

2023 年,幻方宣布启动名为 DeepSeek 的新组织,目标是研究和实现通用人工智能。梁文锋担任 DeepSeek 创始人。

梁文锋很少公开露面。在《揭秘 DeepSeek:一个更极致的中国技术理想主义故事》(《暗涌》对梁文锋的专访)中,他说过一句话:

“真实的 gap 是原创和模仿之差。如果这个不改变,中国永远只能是追随者。”

这句话比“低调”更能解释他。梁文锋关心的是,能不能从跟随已有路线,走向原创研究。

我的理解是,模型可以被追赶,论文可以被复现,一家公司若想持续留在前沿,就需要继续提出并验证新的问题。

二、他的目的地是 AGI

在《暗涌》的两次公开采访中,梁文锋都将 DeepSeek 的目标表述为 AGI,也就是通用人工智能。

这个目标听起来很远,却能解释公司眼前的选择。按照梁文锋在采访中的说法,如果只是尽快做应用,沿用成熟架构是一条更短的路;但以 AGI 为目的地,就要继续研究模型结构、数据和训练方法,在有限资源下获得更强的能力。

从他的表述看,效率不只是模型完成后的成本优化,也被放在扩大模型能力的研究问题里。API 和具体产品可以承接研究成果,但不是他所说的第一优先级。

梁文锋并没有给出一张确定的 AGI 路线图。他在采访中谈到数学与代码、多模态和自然语言三个押注方向,也承认公司内部没有统一答案。目标明确,不等于路线明确。

把 AGI 作为长期方向,可以解释 DeepSeek 为什么持续投入基础研究,却不能保证研究会自然转化为产品和收入。这个目标给出了资源排序,也留下了商业上最难回答的问题。

三、DeepSeek 做了什么

理解了这个目的地,再看 DeepSeek 连续把资源投入了哪些问题,几代模型之间的联系就清楚了。

2024 年发布的 V2,把降低成本写进了模型架构本身。到了 V3,这条路线延伸到整个训练系统。根据 DeepSeek 技术报告的自测数据,V3 在多项基准上取得了与当时领先闭源模型接近的结果。

R1-Zero 则没有把监督微调作为前置步骤,直接进行大规模强化学习。它展示了纯强化学习带来的推理能力,也暴露出可读性差、语言混杂等问题。团队没有藏起这段不完整的探索,而是公开解释缺陷,并给出 R1 的修正路线。

2026 年 4 月 24 日发布的 V4 Preview,官方称 V4-Pro 与 V4-Flash 均支持 100 万 Token 上下文,并继续把效率作为技术重点。

从 V2 到 V4,模型在变化,问题始终一致:怎样在资源约束下继续扩大能力边界。R1 发布时,DeepSeek 还开放了模型权重和技术报告,并同时发布 R1-Zero、R1 及六个蒸馏模型。

Nature Volume 645 Issue 8081 封面

图源:Nature,Volume 645 Issue 8081 封面

2025 年 9 月 18 日 R1 论文发表于 Nature。Nature 后续的人物报道将其称为“首个接受同行评审审查的主要大语言模型”。这是一项外部认可,但对这篇人物稿更重要的是:DeepSeek 曾经连续做出阶段性成果,又持续把结果交给外部检验和使用。

2025 年 12 月 8 日,《自然》(Nature)将梁文锋列入 Nature’s 10,并以“技术颠覆者”(Tech disruptor)作为人物报道的标签。

开放也意味着,任何一代成果都不再由 DeepSeek 独占使用。

问题因此从“这一代模型领先多少”,转向“团队能不能更快提出并验证下一代问题”。

四、他怎样组织人才

模型之外,梁文锋还有一个明确判断:创新的价值最终沉淀在团队,而不只是一代模型的领先。

他在《暗涌》的采访中介绍,参与 V2 研发的成员包括顶尖高校的应届毕业生、尚未毕业的博士生实习生和毕业不久的年轻研究者;他还说,V2 模型团队“没有海外回来的人,都是本土的”。这并不等于年轻人天然更强,而是他不把同类从业经验视为长期研究选人的唯一条件。

在两次采访中,梁文锋分别提到基础能力、创造性、热爱和好奇心。相较于直接寻找有同类经验的人,他更强调这些长期研究所需的条件。在他的说法里,面对没有标准答案的问题,既有经验未必总比重新摸索更有价值。

这不是年轻人崇拜,而是对路径依赖的警惕。

与这种人才观配套的,是梁文锋所说“全是自下而上”的研究方式。团队一般不前置分工,而是自然分工;研究者可以从自己的问题和兴趣出发,主动找人讨论。当一个想法显示出潜力,组织会再自上而下地调配资源,包括人和算力。

MLA(Multi-head Latent Attention,多头潜在注意力)的形成就是一个例子。按照梁文锋在采访中的介绍,一名研究者在总结注意力架构的演变规律后,尝试设计新的方案。从想法到落地,团队为此组建了一个小组,花了几个月时间才跑通。这个过程既不是等待灵感自然变成产品,也不是管理者事先指定答案,而是先给探索留出空间,再为有潜力的方向配置资源。

V2 和后续模型证明这支团队做出过成果,却不能单独证明成果是由这套组织方式造成的,更不能证明它适用于 DeepSeek 的所有阶段。当团队扩大、研究方向增加,产品和客户需求进入以后,自然分工与灵活配置资源能否继续保持效率,仍然没有公开答案。

把这些说法放在一起看,梁文锋对原创的理解不只涉及技术路线,也涉及选人、协作和资源调配。但它不是一套拿来就能复制的管理模板。

五、开源之后,护城河在哪里

梁文锋没有公开发表过一套完整的开源商业理论,但 DeepSeek 已经做出的选择,可以让我们看清其中的基本逻辑。

初版 V2、V3 的模型权重采用附带使用限制的 DeepSeek License Agreement。该协议允许开发者在遵守条款的前提下使用、修改、分发和形成衍生模型。R1 官方发布时采用 MIT License,并明确允许商业使用和蒸馏;V4 官方模型卡也注明,开源仓库分发的资产采用 MIT License。

不同版本的许可边界并不完全相同,但方向很稳定:DeepSeek 不只提供一个聊天入口,还把权重、技术报告和部分推理代码、实现说明交给外部开发者继续使用。

这不是单纯的理想主义。开放会扩大一条技术路线的使用范围,也会让外部开发者更快验证、修改和传播它。与此同时,DeepSeek 仍然通过 API 提供服务。至少从公开动作看,它没有把“开放”和“做生意”看成只能二选一的关系。

论文、权重和工程方法公开以后,外部获得了学习和复现这条技术路线的条件;与此同时,这条路线也获得了更广泛的使用与验证机会。两者是同一个选择的两面。

他押注的是另一种优势:团队在上一代模型中积累 know-how,再以更快的速度提出和验证下一代问题。AGI 决定研究方向,效率研究形成作品,组织方式支持探索,开源让结果接受外部检验,这几件事因此连在了一起。

但这是一项要求很高的押注,而不是已经得到验证的商业答案。单代成果越开放,DeepSeek 越需要持续交付下一代模型;团队扩大以后,自下而上的组织能否保持效率,也要继续观察。这些公开目标和动作本身,并不等于已经形成了可验证的商业闭环。

我的判断是,现有公开信息还不能回答“开源能否带来长期成功”;但从梁文锋的公开表述和 DeepSeek 的行动看,他没有把未来主要押在守住这一代模型上,而是押在还能做出下一代。

资料卡

liangwenfeng

梁文锋(Wenfeng Liang)

个人简介:DeepSeek 创始人,幻方公司创始人之一。

代表作品:他带领团队开发的 DeepSeek,已通过 GitHubHugging Face 发布多代模型的技术报告、代码与开放权重。

推荐阅读:《揭秘 DeepSeek:一个更极致的中国技术理想主义故事》(暗涌专访,36Kr)


高能人物 · 往期推荐

扫码关注公众号
扫码关注公众号
扫码加群交流
扫码加群交流