Deep V 4终于发布了。官方号称有些项目可以和贵它几十倍的模型掰掰手腕,参数量直接翻到1.6T,尺寸比上一代大了一倍还多,国产模型最大上下文长度也一步到位拉到了100万,对齐了目前最顶级的水平。那么这个小鲸鱼实际体验如何,能满足我们对它的期待吗?这个视频带你看完DeepSeek V4,也聊聊我作为一个AI开发者对它的看法。
自从DeepSeek R1发布震惊全世界,直到今年3月,它的网页端好像一点变化都没有,一直是这两个按钮。与之相比,别人都在突飞猛进,甚至还出现了大量DeepSeek已经泯然众人矣的论调。但在水面下,其实是另一方光景。过去这一年,DeepSeek发表了近十篇重量级论文,其中一篇拿了AI最佳论文奖,一篇发在了Nature上。他把训练大模型的成本砍掉了一大半,他给推理流程装了一道筛子,把识别人名、匹配短语这种不用动脑的活直接过滤掉,让算力集中在真正难的问题上。
两个月之前我们还会问DeepSeek为什么要这么轴?难道是他不想要用户了吗?现在知道了,这些科研回报全在V4里面展现了。我认为DeepSeek V4这次对开源世界最大的贡献就是推理效率的突破。在说这个特性之前,我要交代一个背景,不止我们,全世界都在进入算力短缺。AMD的CEO在今年CES上给了一组数字,2022年全球AI算力大约到2025年已经飙到了一百多个,而未来五年还需要再翻100倍,整个AI行业在一瞬间就进入了算力地狱。
原因还要从前几年说起,那时候AI大模型主要是聊天,你问一句他答一句,他很会说话,但也只会说话,说出来的话还不一定靠谱。幻觉不断,很难说除了卖课变现和情感陪伴之外,他还有多少生产力。于是有人就想,哎,光说不做的状态什么时候能突破。时间来到2024年下半年,几个团队几乎同时摸到了一条路:与其让模型一口气给你一个答案,不如让他把任务拆开,一步一步想,每一步给他一个手,也就是调用工具的能力。想查数据就去查,想改文件就去改,想处理数据就自己写一串代码。这个循环一旦跑起来,模型能做的事一下子多了不止一个量级。
这种想一步做一步的循环叫做ReAct Loop,而基于这个循环运转起来的系统就叫Agent。去年年底Agent彻底爆发了。Cursor让AI写出不错的代码,OpenAI直接给你电脑配了第二个小鼠标,大模型从一个只有嘴的聊天对象变成了有手有脚的助手。这种助手让一个叫Peter Levels的独立开发者,从idea到年入百万美元只用了17天;它让Anthropic每发布一个新功能,就有一批软件公司的股价跟着跳水。最神奇的是,大名鼎鼎的龙虾OpenCloud就是Peter Levels一个人开发的,期间没有手写一行代码。
这一点我自己感受最深。我从毕业开始就做文字工作,几乎没有写过代码,但今年靠着AI编程边做边学,我真做出了一个自己的AI政务产品,并且受到了一些社区小伙伴的喜欢。因此,要让Agent自主操作现实世界的机械,也不过是时间问题。所有人都觉得AI就是这条路了,但代价呢?代价是算力消耗爆炸。以前一轮对话可能几百个token就结束了,现在根据调研机构的数据,Agent的token消耗量是原来的5到50倍。无论是厂商、机构还是数据中心,都面临着算力慌。而这个局面刚好撞上了一家公司的基因。
DeepSeek做量化基金出身,骨子里的逻辑就是用最少的资源撬动最大的收益,再加上众所周知的原因芯片受限,所以他不得不在有限的硬件条件下把效率做到极致。V4身上处处都是这种思路的体现。大语言模型内部有很多专家模块,V3有256个专家,每次派八个上场;V4把专家池扩大到384个,但每次只派6个上场的反而更少了。他用了一套新的注意力机制,让模型在处理长文本的时候大幅减少计算量。他还换了一种更高效的训练方法,只要传统方案大概一半的计算量就能到同样的效果。所有设计都指向同一个方向:保持模型的聪明度,但是用更少的算力。
这种效率优势反映到价格上有多夸张呢?V4的小模型Flash版输出只要两块钱100万token,同级别的海外模型少说也要几十块;大模型Pro版24块,对面报价100出头。同等实际性能下,差距能有5到20倍。而且据说等下半年华为昇腾芯片大规模部署之后,价格还会进一步往下压。从各方测评和我自己的体感来看,大号的Pro版已经超过了Claude Sonnet 4.5,接近当前最强模型的水平。有意思的是,去年芯片受限还只是中国公司的特殊处境,海外厂商并不缺算力,没想到今年Agent一来,全世界都在抢算力,DeepSeek被逼出来的这套打法反而成了全行业最需要的解题思路。而这些公开的科研成果,接下来大概率会被越来越多的大模型公司借鉴。
翻开V4的更新说明,你很难不注意到一件事:编程能力占了最大的篇幅。其实不只是DeepSeek,你去看今年任何一家大模型的更新日志,排在最前面的几乎都是编程,恨不得把跑分贴到你脸上。可是编程跟我们大多数人有什么关系?关系还挺大的。举个例子,这是我开发的Agent。如果不把过程中的工具调用隐藏掉,它输出的原文就是这样的:回答夹杂在各种工具指令和格式之间。比如这里是网络搜索,以防AI幻觉编一个答案糊弄你;比如说这里是调用另一个Agent来审查结果;然后这里又是先看看你写的Skill,保证接下来的工作和你对齐。这些日常场景里不被看见的代码输出,保证了能被看见内容的质量。
之前DeepSeek在这方面其实表现不差,但和今年的尖子生比还是有点不够看的。V4在这个方向上下了很大功夫,是去年科研成果的集大成。拿两个硬指标来说,算法编程的CodeForce评分达到了3206,超过了Claude Opus 4.6和GPT 5.4;实际软件工程的SWE Verified也做到了80.6,和最强的几家几乎齐平。虽说跑分这件事并不完全代表实际体验,但我个人用下来感受和前沿大模型差不了多少。我尝试了一个我自己做的复杂的写作Skill,找方向、打草稿、写大纲,他执行的都很不错。在过程中问别的Agent时,系统报了错,他也自己尝试了别的办法,让流程顺利推进了下去,聪明程度确实提高了。
如果你这几个月打开DeepSeek官网问它是什么模型,它会藏着不说。但有一件事它特别主动给你强调:它能装下一部《三体》,有100万上下文。上下文长度是过去DeepSeek最大的短板。这个概念指的是模型一次能看到的信息量,以前只有聊天内容几千字绰绰有余,但在Agent的时代,各种代码信息以及格式全部被塞了进去,128K很快就捉襟见肘。主流模型都已经200K起步,头部玩家做到了100万,但是贼贵。在过去,很多人不用DeepSeek,很大一部分原因就是上下文太短了,并不是因为它真的不够强。特别是在创意写作这块,它一直挺能打的。这次V4直接拉满,让人诟病的短板现在变成长板了。更夸张的是输出长度,单次输出上限就有384K,一轮就可以把《黑暗森林》复述一遍还有余。
最后这个更新我觉得也很重要:V4的大模型和小模型是同时推出的。小号模型保持了大部分的能力,但是价格便宜到让人没法理解。做AI应用开发之后,我有一个很深的感受:很多任务根本不需要大尺寸的模型,摘要、翻译、格式整理这些活,需要的是一个够快够稳的小模型。这样下来可以在保持同样智力的情况下显著减少运行的成本。当然V4也有明显的缺口,最大的一个是它依然是纯文本模型。现在主流模型基本都能处理图片、语音甚至视频,V4在这块还是零。我觉得如果加上多模态的话,最后实际体验肯定还会好很多。
回看前面聊的这四件事,有一个共同点:全是底层能力。DeepSeek的精力全花在造引擎上,开源出来让开发者拿去造自己的车。这次视频调研过程中,我从论文和一些公开报道里看到了几个有意思的细节。V4的论文里引用了Kimi团队做过验证的优化器,而Kimi的K2也用了DeepSeek早期提出的注意力架构,两家开源产品在各自的核心技术上互相借鉴,互相致谢。这种开放拼命卷的行业里不常见,但它确实在发生,而且结果也是好的,让更多人用上了更强大、更便宜的模型。
这种氛围也延伸到了同行之间的互动。论文评测部分直接写了一句“K2.6和智谱M5.1的API太忙了,没法返回结果,所以留空”,智谱看到后回了一句“哥们儿你想要的话高速率账号安排上”。论文本身的写法也挺特别,致谢只有一句话,评测部分坦诚写了哪些地方还落后闭源模型3到6个月。不卑不亢的。看完这些,我觉得这个团队是知行合一的:说开源MIT协议拿去用,说长期主义就扎在科研里半年不吭声。外面传了好几轮遇到问题了被超越了,小鲸鱼不语,只是一味跳票,然后发论文。面对蒸馏、人才流失这些非议,DeepSeek选择沉默,然后在某个周五端出模型,并引用《荀子》:“不诱于誉,不恐于诽,率道而行,端然正己。”而我觉得最适合他的是墨子的一句话:“夫爱人者,人必从而爱之;利人者,人必从而利之。”
