DeepSeek过于朴素了
日期:2026-04-28 09:54:49 / 人气:46

“不诱于誉,不恐于诽,率道而行,端然正己。”
这是4月24日,DeepSeek在发布V4预览版时,写在公众号文章末尾的一句话。放在当下国产大模型群雄逐鹿的语境中,这句话的内涵格外清晰:无论外界如何期待、如何猜测,DeepSeek始终坚守自身节奏,不被赞誉裹挟,不被情绪左右,在喧嚣的行业中走出了一条独属于自己的“朴素”之路。
甚至相比于其他几家头部基座模型公司,DeepSeek的“朴素”显得尤为突出——它不刻意刷榜争夺虚名,不急于推进商业化变现,不刻意优化面向C端的用户体验,更像是整个行业的“修路人”,默默深耕底层技术,筑牢大模型发展的根基。
时间拨回至DeepSeek R1发布当天,这款模型一经亮相便引爆行业,成为当时国产大模型领域的“现象级”产品。而在往后的459天里,行业格局发生了剧烈变化:智谱、MiniMax两大国产模型纷纷登陆资本市场,市值均一度冲破3000亿元,国产大模型首次被资本市场正式定价;与此同时,Kimi、Qwen等模型也频频在各类榜单登顶,持续抢占市场关注度。
就在DeepSeek正式发布V4后的几分钟,资本市场再次给出了鲜明反馈。约上午11时05分,港股大模型板块快速震荡,智谱与MiniMax股价双双跳水,盘中一度分别跌超10%和12%。这一波动背后,是市场对DeepSeek新模型的高度关注,也让DeepSeek被不断投射为下一次行业格局变动的核心变量。
但与行业的热闹喧嚣形成鲜明对比的是,在这459天里,DeepSeek始终悄无声息。不同于其他厂商的高频曝光、频繁迭代,它几乎没有发布过多吸引眼球的动态,只是默默打磨技术,直到V4预览版的正式亮相。
而这款备受期待的新模型,却并未如大众预期那般,成为一款“震惊行业”的顶尖模型——至少,它的“领先”并非行业榜单所定义的那种锋芒毕露。据Artificial Analysis数据显示,V4 Pro在世界知识类benchmark中已跻身全球前列,仅次于Gemini-Pro-3.1;综合表现来看,DeepSeek V4已领先多数开源模型,整体性能开始逼近顶级闭源模型。
也就是说,DeepSeek本有能力冲击“行业顶尖”的虚名,但它从未将这作为自身的追求。从始至终,它给自己的定位都很清晰:追求极致的性价比,深耕底层效率优化,而非争夺表面的榜单排名。
和其他基模公司比,DeepSeek过于朴素
在国内几家头部基座模型公司中,DeepSeek始终带着一种独特的气质——朴素。这种朴素,无关产品的简单与否,也无关技术的激进程度,核心在于它从未像一家标准的AI创业公司那样,被融资节奏、商业化压力和市场情绪推着走。某种程度上,它不急着向市场证明自己能赚多少钱,也不急于通过流量和曝光获取关注,因此反而拥有了更充足的空间,去做自己真正想做的事——打磨底层技术,优化模型效率。
虎嗅对比国内几大基座模型的技术路线后发现,与DeepSeek气质最相似的,是Kimi(月之暗面)。两家公司都带着鲜明的技术理想主义色彩,也都曾凭借过硬的模型能力,在行业中打出了属于自己的辨识度。就在DeepSeek V4发布前两天,Kimi刚刚推出K2.6版本,并宣称其是发布以来最好的代码模型;与此同时,DeepSeek在V4的发布文章中也提到,他们内部已将V4作为员工使用的Agentic Coding模型,重点强化代码相关能力。
这意味着,两家公司都将代码能力视作模型核心价值的重要方向。除此之外,两者的相似点还有很多:DeepSeek V4的一大核心特点,是原生支持1M上下文,并强化长链路推理能力;而长上下文处理、复杂任务拆解,也是Kimi过去一年来持续强化的核心标签。
如果只看表面的能力边界——代码、长上下文、复杂任务处理,Kimi与DeepSeek似乎正在越来越靠近,甚至可以说,两家公司的发展方向完全“撞车”。但如果深入拆解两者的技术路线,就会发现,它们看似同向,实则走的是两条截然不同的道路。
Kimi过去长期深耕的,是线性注意力路线。其核心思路是,在保证模型具备超长上下文、多步骤任务处理能力的前提下,将计算成本控制在可接受范围,再通过叠加Agent系统、任务编排、多轮调用等能力,让模型成为一个可以持续高效工作的执行系统,更好地适配实际工作场景。
而DeepSeek V4在技术报告中明确提出,其采用的是混合注意力架构(Hybrid Attention):通过CSA(压缩稀疏注意力)与HCA(重度压缩注意力)交替配合,对历史上下文进行分层压缩和选择性读取,在稳定支持百万级上下文能力的同时,大幅降低模型的推理成本。据其技术报告数据显示,在100万token的场景下,DeepSeek V4-Pro的单token推理FLOPs(浮点运算次数)降至上一代模型的27%,KV Cache占用更是降至10%,效率提升极为显著。
简单来说,两者的核心差异在于:Kimi的思路,更像是在任务层做“加法”——把复杂任务拆分成多个步骤,组织多个智能体协作完成,最大化优化用户的使用体验;而DeepSeek的思路,则是在系统层做“减法”——先一点点解决底层技术存在的痛点,筑牢技术地基,让模型在底层计算结构上变得更高效、更经济。
按照这个逻辑不难得出一个结论:在处理同一项复杂任务时,Kimi往往会消耗更多的token。原因并不复杂:当模型承担真实的工作流程时,token消耗不再仅仅是用户的输入与最终的输出,还包括任务拆解、中间推理、多轮调用、工具返回结果、错误修正,以及多个Agent之间的上下文同步。很多时候,用户只输入一句话,后台可能已经完成了十几轮的运算,token消耗自然随之增加。
当然,这并不意味着Kimi的技术路线存在问题。在当前AGI(通用人工智能)技术路线尚未收敛的背景下,任何一种探索都有其自身的优劣势,没有绝对的“正确”与“错误”。作为一家更强调商业化落地的公司,Kimi所做的,是优先优化用户体验,让企业和个人用户愿意为模型的能力付费——某种程度上,它已经接近一款“可交付的生产力工具”。如果一个模型多消耗一些token,却能为用户节省3小时的工作时间,这笔投入产出比其实非常划算。
本质上,Kimi追求的,是token被消耗后的“产出效率”——即单位token能为用户创造多少价值;而DeepSeek追求的,是token本身的“计算效率”——即如何用更少的token、更低的算力,实现同等甚至更优的模型能力。这两种选择的背后,鲜明地体现出两家公司截然不同的企业底色。
DeepSeek背后的母公司是幻方量化,而幻方本质上是一家量化交易机构。量化交易天然强调两件事:效率与收益率。任何交易策略都要精准计算投入产出比,任何系统都要追求极致的速度、稳定性与资源利用率。在这样的企业文化下成长起来的DeepSeek团队,会很自然地将“效率”作为模型研发的核心追求。
这也解释了为什么DeepSeek总在做一些看起来不那么“热闹”,却对行业发展至关重要的事情:MoE(混合专家模型)优化、推理效率提升、注意力架构重构、算力利用率改善……这些工作没有榜单排名的光环,也无法直接带来商业化收入,却能实实在在地降低大模型的研发和使用成本,解决行业发展的底层痛点。
对幻方而言,大模型未必是一门独立的生意,但它首先是一套能够提升研究效率、分析效率与决策效率的基础工具。换句话说,幻方创始人梁文锋或许并不关注DeepSeek能为公司带来多少直接收入,他有着更长的时间尺度,也更能接受“先做难而慢的事”,深耕底层技术,等待长期价值的爆发。
Kimi则完全不同。月之暗面从创立第一天起,就是一家标准意义上的AI创业公司。它需要通过融资获得发展资金,需要通过用户增长证明自身价值,需要向市场和投资者证明,模型能力最终能够转化为真实的商业收入。尽管创始人杨植麟也有着强烈的AGI理想主义色彩,但Kimi必须直面商业化的现实压力——这也决定了,Kimi会更积极地靠近用户需求、代码需求、Agent需求和付费需求,其模型迭代、产品更新、组织发展的节奏,都更像一家需要持续奔跑、不断突破的创业公司。
所以,即便两家公司看似都在深耕长上下文、代码模型和复杂任务处理,但其核心目标截然不同:Kimi解决的是“如何让模型更好用、更能创造商业价值”的问题,而DeepSeek解决的是“如何让模型更高效、更经济”的问题。这也是为什么DeepSeek在行业中总显得“不着急”——它的节奏,从来都不被外界的喧嚣所左右。
国产替代,仍在路上
在DeepSeek V4发布之前,外媒曾多次“预告”,称DeepSeek将完全切换至国产芯片进行模型训练,逐步摆脱对英伟达GPU的依赖。这一消息曾引发行业广泛关注,毕竟,在芯片受限的背景下,“摆脱英伟达依赖”几乎是所有国产大模型公司的共同追求,而DeepSeek作为行业内的技术标杆,其动向自然备受瞩目。
然而,从DeepSeek V4发布的技术报告来看,这一“预告”并未成为现实。报告中仅明确提到,DeepSeek已在NVIDIA GPU和HUAWEI Ascend NPU平台上,验证了EP(专家并行)方案,但并未提及“已切换至华为昇腾芯片进行训练”。
更准确地说,这一表述意味着,DeepSeek已经在系统层面完成了跨平台适配,至少让V4这类MoE模型能够同时运行在英伟达和昇腾两套硬件架构之上。但这并不直接等同于,其核心的模型训练任务已经彻底脱离英伟达芯片——事实上,DeepSeek极有可能依然依赖英伟达芯片完成核心训练工作,而用国产芯片承担推理任务。
这其实是当前国产大模型行业最现实、最理性的发展路径。原因并不复杂:模型预训练阶段对芯片生态的要求极高,涉及大规模并行训练、通信带宽、编译器成熟度、故障恢复能力以及长期稳定性等多个维度,而英伟达芯片经过多年发展,已经形成了完善的生态体系,能够更好地支撑大规模预训练任务;相比之下,推理环节对算力的要求更分散,也更适合率先完成国产替代。因此,许多国产大模型公司采取的策略,并不是“一步到位切换训练底座”,而是先从推理侧开始迁移,逐步积累技术经验,再向训练侧渗透。
有多位行业人士在接受虎嗅采访时表示,“如果真的彻底切换至国产芯片进行训练,V4可能不会这么快到来。”这一观点也从侧面印证了,当前国产芯片在支撑大规模模型预训练方面,仍存在一定的提升空间。
不过,相比于“是否切换至国产芯片训练”,DeepSeek在工具链层面的变化,更值得行业关注。过去,DeepSeek曾因深度使用PTX编程语言而受到行业关注。PTX可以理解为英伟达GPU生态中的底层中间语言,接近汇编层,能够极致榨取单卡性能,但它也有明显的局限——天然绑定英伟达体系,开发门槛高,可迁移性极差,一旦脱离英伟达芯片,基于PTX开发的技术就难以复用。
而在V4的技术报告中,DeepSeek不再强调PTX,而是重点提到了DSL(领域专用语言),例如其采用的TileLang,就是一种面向AI算子优化的DSL,能够在保证模型性能的同时,平衡开发效率与运行效率。两者的核心区别在于:PTX是直接操作英伟达机器的底层语言,追求极限性能,但强绑定英伟达;DSL则是一层中间抽象,能够让研发团队在保持性能的前提下,更快地开发算子,也更容易适配不同的芯片平台。
这一变化意味着,DeepSeek虽然尚未完成国产芯片训练替代,但已经开始主动摆脱对英伟达体系的强绑定,为未来逐步切换至国产芯片训练奠定了基础。这种“循序渐进”的策略,既符合行业发展的现实,也体现了DeepSeek“朴素”背后的理性与长远——不急于追求“国产替代”的虚名,而是脚踏实地,一步步完善技术体系,稳步推进替代进程。
不做被期待的DeepSeek
DeepSeek并不打算成为外界期待中的那个DeepSeek。过去一年,行业给DeepSeek赋予了太多角色:有人期待它再次复制R1发布时的辉煌,推出一款重新震动行业的顶尖模型;有人期待它成为中国大模型摆脱英伟达依赖的“标杆”;还有人期待它加快商业化步伐,与智谱、MiniMax、Kimi等厂商同台竞争。
但V4的发布,彻底打破了这些期待——DeepSeek并没有被外界的期待打乱自己的节奏,它依然是那个围绕“效率”做模型的公司。混合注意力架构、KV Cache压缩、百万上下文推理成本下降、专家并行优化、跨平台Kernel设计……这些技术改进,没有华丽的包装,不算“性感”,也无法直接吸引流量和关注,但每一项都切中了行业发展的痛点,都在逐步解决大模型目前依然存在的瓶颈。
从这个角度来看,DeepSeek已经和其他基座模型公司不在同一维度上了。当不少公司还在争夺用户入口、抢占市场份额、追求商业化变现时,DeepSeek更关心的是,如何把单位智能的成本继续压低,如何让同样的模型能力消耗更少的算力,如何为整个行业的长期发展筑牢技术地基。
所以,DeepSeek在V4发布文章末尾写下的“不诱于誉,不恐于诽,率道而行,端然正己”,与其说是一种姿态,不如说是向整个行业的表态:它不会被外界的赞誉或质疑所裹挟,也不会为了迎合市场而改变自身的发展节奏,它会继续做那个更冷静、更朴素、更专注于底层技术的DeepSeek。
在喧嚣的AI赛道上,太多公司急于证明自己,急于抢占先机,而DeepSeek的“朴素”,或许正是一种难得的清醒。它用自己的节奏告诉行业:大模型的发展,从来都不是一场短跑,而是一场长跑;相比于追求表面的光环,深耕底层、优化效率、创造长期价值,才是更重要的事情。
作者:奇亿娱乐
新闻资讯 News
- 老牌高跟鞋玖熙想在中国卷土重来09-13
- 欧莱雅为什么要投一个抖品牌?09-13
- 美债剧烈震荡、全球市场恐慌!罕...09-13
- AI末日论持续发酵:业内频发风险...09-13

