尖顶易攀,地基难掘——为什么 AI 最先攻克的是数学与编程,最难攻克的又是什么?

文章导读: 这篇文章深刻探讨了人工智能在数学与编程领域率先取得突破的底层逻辑,指出其核心在于可验证性与封闭系统提供的廉价反馈。作者认为,决定模型攻克难度的并非人类体感的智力高度,而是任务是否具备明确规则、唯一答案及低成本失败的特性。 相比之下,AI 在处理依赖身体经验的物理动作、缺乏客观判官的审美品味,以及无法言传的默会知识时仍面临巨大阻…

尖顶易攀,地基难掘——为什么 AI 最先攻克的是数学与编程,最难攻克的又是什么?封面

文章导读:

这篇文章深刻探讨了人工智能在数学与编程领域率先取得突破的底层逻辑,指出其核心在于可验证性与封闭系统提供的廉价反馈。作者认为,决定模型攻克难度的并非人类体感的智力高度,而是任务是否具备明确规则、唯一答案及低成本失败的特性。

相比之下,AI 在处理依赖身体经验的物理动作、缺乏客观判官的审美品味,以及无法言传的默会知识时仍面临巨大阻碍。这种现象揭示了一条与人类认知完全倒置的难度阶梯:逻辑理性的尖顶易于攀登,而根植于生活的直觉地基反而难以撼动。最终,真正的挑战不在于解决已知问题,而在于那些处于开放语境且缺乏统一标准答案的未知领域。

一、那道“送分题”,恰恰是最好的证据

让六个顶尖模型挑战 2007 年江苏数学卷前十六道选择题和填空题,结果并不令人意外:国外三家模型拿到满分,其中一家只用了几十秒就交卷;国内模型中也有满分表现。真正值得注意的,不是“AI 到底会不会做数学”,而是这个结果来得太顺理成章了。

更关键的问题其实是:为什么在众多能力中,数学和编程最先被 AI 突破?这种“被攻克的先后顺序”并非偶然,背后隐藏着一条近乎可以预测技术演化方向的线索。

而且耐人寻味的是,高考前十六题恰恰是这条隐线最干净的样本。它们封闭、自足、唯一解、可机器判分——几乎是为今天这类机器量身定做的题型。所以与其说“AI 攻克了数学”,不如说“数学里最适合被这种机器攻克的那一部分,最先交了出来”。

二、不是因为数学“简单”,而是因为它“可被验证”

先要破掉一个直觉。数学和编程,恰恰是人类自己觉得最难、最需要天赋、最能彰显理性高度的东西。如果“攻克次序”是按人类感受到的难度来排,它们本该排在最后。它们却排在了最前——这说明,决定次序的根本不是“对人有多难”,而是某种对机器有多友好的隐藏属性。

这个属性的核心,是可验证性。一道证明要么严丝合缝,要么不成立;一段代码要么编译通过、跑过测试,要么报错。对错有一个客观、廉价、可自动判定的信号。这一条看似平淡,却是整场突破的引擎。今天这些模型都开启了“深度思考模式”——这绝非巧合。

推理模型的跃迁,本质上靠的就是一种“带可验证奖励的强化学习”:把海量题目自动生成出来,让模型反复尝试、自动判分、对了就奖励。哪里能廉价又客观地判分,强化学习的飞轮就能在哪里转起来;而数学和代码,正是判分最便宜的两块田。验证一旦自动化,模型甚至可以左右互搏、内部对弈、把能力练上去——这是别的领域羡慕不来的奢侈。

可验证性之外,还有几条彼此叠加的便利。

其一是形式的封闭性:数学符号与编程语言都是规则明确的形式系统,一行代码的意义就是它的运行结果,意义由系统内部的规则决定,而不必指向外面那个含混的世界。这一点正对应维特根斯坦区分“规则固定的形式语言”与“嵌在生活形式之中的自然语言”的那条裂缝。

其二是数据的丰沛与自带标注:GitHub 上数十亿行代码、arXiv 上的论文、教材与竞赛题库,不仅海量、结构化,而且常常自带测试与文档——数据与“判官”是打包一起来的。

其三是可组合与短反馈:程序由可拼装的小单元构成,错误能被定位,跑一下立刻知道对错。

其四,也许是最容易被忽略的一条——它不需要身体。纯符号操作意味着可以免费失败十亿次,练习中没有任何不可逆的代价。

把这几条合起来,就会发现数学和编程几乎集齐了“易于被这类机器攻克”的全部条件:有判官、规则封闭、数据充足、反馈即时、失败免费。它们最先沦陷,不是因为浅,而是因为它们恰好长成了机器最容易啃的形状。

三、真正的边界,不在学科之间,而在学科之内

但这里必须诚实地补一刀,否则“攻克”二字会被严重高估。

沦陷的从来不是“数学”这个整体,而是数学里可被形式验证、且语境自足的那个子集。竞赛题、高考题沦陷了,因为它们边界清晰、答案唯一、所需信息全在题面之内。可是研究级的数学——决定该证哪个定理、该发明哪个概念、该如何重新框定整个领域——并没有沦陷,因为“这是不是一个好问题”没有任何编译器能判定。

格罗滕迪克的伟大不在于算得快,而在于他知道该把水位抬到哪里,让难题自己浮起来;那种眼光,至今没有判官。

编程同理。LeetCode 沦陷了,但维护一个百万行、塞满历史包袱与隐性业务语境的遗留系统,在生产环境里排查一个只在凌晨高峰复现的诡异故障——这件事比刷题难得多,因为它的关键信息根本不在代码里,而在一群人的脑子里、在那些没人写下来的约定里。

所以真正的界线不是横在学科与学科之间,而是竖着切穿了每一个学科,把“可验证、语境自足”的那一半,和“靠判断、依赖默会语境”的那一半分开。高考前十六题,正好整整齐齐落在前一半的甜区里——这恰恰是它最先被攻克的原因,而不是反例。

四、那么,最难攻克的是什么?

把上一节那条界线翻过来看,答案几乎自动浮现:最难攻克的,正是同时缺失了“可验证”与“封闭性”这两样东西的地方。它大致聚成四团。

第一团,是没有判官的“品味与判断”。在数学里是“该证什么”,在工程里是“该建什么架构”,在设计里是“什么才算好”,在创造力主题里,就是最难的那一步——提出对的问题,而不是解决一个已经摆好的问题。“对不对”可以交给编译器,“值不值得、美不美、该不该”却没有任何自动信号可以拿来训练。

强化学习再强,也无法朝着一个连判官都认不出来的答案去优化。

第二团,是身体与物理世界,也就是著名的莫拉维克悖论。莫拉维克在上世纪八十年代就点破:让机器通过智力测验、下棋、做积分相对容易,要给它一个一岁孩子的感知与行动能力却近乎不可能。今天依然如此——AI 能解奥数,却折不好一件衬衫;能写论文,却拧不好一根水管。

原因还是那条隐线:物理世界高维、连续、不可逆,而且每一次尝试都要花真实的时间、真实的材料、真实的磨损。那台在数学上“免费失败十亿次”的引擎,一进入现实就熄火了——没法让机器人免费摔十亿次,更没法把打碎的杯子复原。机器人之所以慢,常常不是算法不够聪明,而是“经验”本身太贵。

第三团,是默会之知。波兰尼那句“人所知者,常多于所能言传”,几乎是为今天这场博弈写的判词。老师傅的手感、老中医的直觉、骑自行车的平衡、社交场上一瞬间的分寸——这些知识从不在文本里,也无从被验证,于是天然地落在当前范式的射程之外。一个文明把多少最珍贵的能力,藏在了“说不出来”这三个字里,今天才第一次被清点出来。

第四团,是真正的“新”。模型学的是人类知识的分布,擅长在已有语料的凸包之内做精彩的插值;而真正的范式革命——库恩意义上的那种,爱因斯坦不是把方程算得更快,而是重新构想了时间与空间——要求走到分布之外去。

这一团也必须给出反方:也有人认为人类的创新本就是重组,而 AlphaFold、AlphaTensor 乃至那著名的“第 37 手”,已经找到了人类未曾设想的东西;随着世界模型与内部博弈环境越来越丰富,越来越多的“品味”与“新意”也许会被改写成一个可验证的搜索问题,判官的疆界本身在不断外扩。

所以这一团究竟是永久地难,还是只是暂时地难,是个尚未有定论的真问题——而不是一句可以拍板的结论。

五、一条颠倒的难度阶梯

把这四团放在一起,那条隐线就完整了:攻克的次序,跟随的是“可验证性”与“封闭性”,而几乎与人类感受到的难度无关——甚至是颠倒的。

人类花了几千年,把高等数学、形式逻辑、优雅的证明,供奉为理性大教堂的尖顶;而把走路、抓握、认脸、看一眼就知道哪个问题更美——这些与一个幼童、甚至与一只动物共享的本能——视作理所当然的地基。如今的吊诡在于:尖顶易攀,地基难掘。

那座教堂⛪️最高、最炫目、最“理性”的塔尖,恰恰因为它最形式化、最脱离身体与世界,而最先被机器登顶;真正岿然不动的,是沉在身体里、世界里、默会里的地基。借用教堂穹顶这个意象来说:机器🤖先爬上了穹顶的十字架,却仍卡在地基的第一块石头上。

换句话说,对“像人类这样的心智”而言的难度阶梯,和对“像机器这样的系统”而言的难度阶梯,根本是两条不同的、近乎倒置的阶梯。人类最引以为傲、最觉得自身是“理性存在”的那些能力,反而最先失守;而那些与孩童共享、或与老匠人无言相通的能力,却守到了最后,甚至可能永远守得住。

六、尾声:没有判官的疆域

最后还得把话说稳。以上是 2026 年这个时点上的前沿地形,而不是终局的判决。身体那一团,正在被机器人与世界模型猛攻;品味与新意那一团,究竟是被永久挡在门外,还是只是等着判官的疆界扩张过去,如前所述,仍是悬而未决的真问题。诚实的态度,是描述清楚“为什么在当前范式下它难”,而不是替它判一个形而上学的死刑。

但有一点大概是稳的:最难被攻克的,恰恰是最难被形式化的——因为“做人”这件事,本来就不是一套形式系统。维特根斯坦说意义栖身于生活形式之中,那些没有判官、指向一个开放而不可逆的世界、又只能意会的东西,之所以难,正是因为它们从一开始就拒绝被折叠进任何规则手册。

攻克数学和编程,确实可行,而且可行得很彻底。但更难、也更有意思的那道关,不在有标准答案的考卷上——它在那片没有判官的疆域里。机器最先替人类爬上的,是理性的尖顶;最后留给人类、也最考验人类的,是那片连对错都还说不清的旷野。