AI 3.0

聚焦具身智能(Embodied AI)革命:从谷歌PaLM-E模型控制机械臂,到宇树科技H1人形机器人的运动算法,解析多模态感知与物理交互的融合难题。对比特斯拉Optimus与波士顿动力Atlas的技术路线,预言具身智能将重塑制造业与服务业。

作者
梅拉妮·米歇尔
进度
0%
时长
7分钟
最后阅读
2026-09-20
划线
25
想法
17
AI 3.0封面

元数据

高亮划线

05 ConvNets和ImageNet,现代人工智能的基石

ConvNets和ImageNet,现代人工智能的基石

2026-09-20 08:41:32

如果用通俗的话解释,这里类似于:假设你是一个厨师,你正在参加一个烹饪比赛,比赛的规则是使用指定的食材做出最好的菜品。这个指定的食材就像ImageNet,它是一个包含了大量图像的数据集,图像中包含了各种各样的物体,比如狗、猫、汽车、房子等等。

而你的烹饪技能就像ConvNets,它是一种深度学习模型,可以通过分析ImageNet中的图像,学习到如何识别和分类各种物体。在比赛中,你需要使用你的烹饪技能和指定的食材,根据比赛的主题,创作出一道美味的菜肴。同样,ConvNets和ImageNet是现代人工智能的基石,它们通过大量的数据和复杂的算法,使得计算机能够识别和理解我们周围的图像、声音、文字等各种信息。

2026-09-20 08:42:00

从20世纪80年代开始,经历了神经网络研究的一个又一个“寒冬”和“春天”。

2026-09-20 08:42:19

耐得住寂寞,守得云开见月明,不容易哦。经历寒冬,是不是还有寒冬呢?

2026-09-20 08:42:29

LeNet凭借手写数字识别功能在商业上获得了成功,从20世纪90年代到21世纪初,LeNet被美国邮政局用于自动识别邮政编码,并被银行业用于自动读取支票上的手写数字。

2026-09-20 08:42:45

杨立昆、辛顿和神经网络的其他拥护者认为,只要具备足够多的训练数据,改进的、更大规模的ConvNets和其他深度网络就能够征服计算机视觉。

2026-09-20 08:42:50

直到2012年,ConvNets在一个名为ImageNet的图像识别数据库上赢得了计算机视觉竞赛,由ConvNets研究人员传递的这只火炬突然照亮了计算机视觉研究的世界。

2026-09-20 08:42:56

首届ImageNet挑战赛于2010年举行,获胜算法是支持向量机算法,第二届参赛人数锐减,获胜的同样是支持向量机算法,准确率只提高2个百分点左右,几乎没有任何真正的进步。第三年AlexNet出现了,这个卷积神经网络算法的识别准确率比上一年高出10个百分点。继罗森布拉特的感知机、福岛的新认知机和杨立昆的LeNet之后,AlexNet实现了计算机视觉领域的新跨越。

这一步早就应该迈出,却历经了数十年的酝酿终于横空出世,利用大型数据集充分彰显了潜力。

多年来,李飞飞的实验室将所有赌注都押在了长达数年的、规模空前的数据追寻上,而辛顿的实验室则将他们的声誉都押在了卷积神经网络这套几乎已经被专业领域抛弃的算法上。他们都在赌,都有可能赌错。可以说,AlexNet和ImageNet是相互成就,它们是同步发展的。

“这么多年来,我一直希望ImageNet能够推动新事物的诞生,现在我终于明白,一切的一切,都是为了认可和表彰一种永恒的成就,我们对此刻期待已久。受生物学启发的算法几十年来一直凝视着我们,它只是需要适当的挑战,才能充分展现出来。”

2026-09-20 08:43:14

人工智能的研究者是具有竞争力的一群人,因此他们喜欢通过组织比赛来推动这一领域发展也就不稀奇了。

2026-09-20 08:43:42

每个比赛均有一个特色的“基准数据集”,就是一个照片集,其中的每张照片上都有人工创建的用于标注对象的标签。

2026-09-20 08:43:47

谷歌不会把那些我标注过的图像验证码用作训练集了吧

2026-09-20 08:44:04

计算机视觉程序能够将图像作为输入(在看不到人工创建的标签的情况下),然后用20种类别作为输出,来判定某一种类别的对象是否出现在图像中

2026-09-20 08:45:04

从图片中识别出一种物体实际上是一种很低的智能,人类以及很多动物都具有可以识别一个物体的立体形状的能力,并能识别出物体在空间中的位置,将二维的图片识别为三维的空间是一种更复杂的智能。对物体的颜色的识别也是动物的更复杂的智能。

2026-09-20 08:45:07

在竞赛前,竞赛组织者将提供在线的训练集,当竞赛开始时,研究人员需提交他们训练好的、将在保密的测试集上进行测试的程序。对测试集中的图像的目标识别准确率最高的程序获得胜利。

2026-09-20 09:08:24

竞赛其实跟做工程项目是一样的,都是在有限的时间内,调动有限的资源,达成一个具体的目标。

不同于工程项目的地方在于评价维度较为单一,可也正是这种单一,使得解决问题变得聚焦,解决思路变得开阔,如果只盯着它激发起人性中的那种不良反应,诸如焦虑、嫉妒等,如果忽略了这些知识提升和思路开阔等方面,没有站到一个主办竞赛者的角度来看待竞赛,那么是很难在竞赛中脱颖而出的。

2026-09-20 09:08:39

此外,具备足够多图像的数据集,可以供参赛程序学习视觉对象形态的所有可能的变化,以便具有更好的泛化能力,然而,这样的数据集目前也尚未出现。

2026-09-20 16:03:05

泛化能力是机器学习中的一个关键概念,它指的是模型在训练完成后,能够在新数据或真实环境中表现良好的能力。简单来说,泛化能力就是模型对未见过的数据的适应能力。

泛化能力(Generalization Ability)是指机器学习算法对新样本的适应能力。理想的模型不仅要在训练数据上表现优异,还要能够很好地处理未见过的数据。泛化能力强的模型能够从训练数据中学习到通用的规律,而不是仅仅记住训练数据的细节。

泛化能力的重要性

  • 实际应用: 在实际应用中,泛化能力强的模型更具实用性,因为它们能够适应各种新的、未见过的场景。

  • 过拟合与欠拟合: 如果一个模型在训练数据上表现很好,但在测试数据上表现不佳,这通常意味着模型的泛化能力较差,可能出现了过拟合现象。

影响泛化能力的因素

  • 数据量: 通常,训练数据量越大,模型的泛化能力越强。

  • 模型复杂度: 过于复杂的模型容易在训练数据上表现优异,但可能在泛化到新数据时表现不佳。

  • 训练策略: 适当的训练策略可以帮助提高模型的泛化能力,例如使用正则化技术减少过拟合。

提高泛化能力的常用方法

  • 交叉验证: 使用交叉验证可以有效评估模型的泛化能力,避免过拟合。

  • 正则化: 如L1和L2正则化,可以限制模型的复杂度,提高泛化能力。

  • 数据增强: 通过增加训练数据的多样性,可以增强模型的泛化能力。

2026-09-20 16:03:15

普林斯顿大学教授、心理学家乔治·米勒(George Miller)负责的项目:创建一个英语单词数据库(WordNet),将单词按同义词分组,并从最具体到最一般化的等级进行层次结构排序

2026-09-20 16:04:08

这是一个原始的知识图谱吗……层次结构排列,工作量巨大

2026-09-20 16:04:21

卡布奇诺→咖啡→软饮料→食品→物质→物理实体→实体。

2026-09-20 16:04:45

WordNet已经并将继续被心理学家和语言学家广泛应用于科学研究以及人工智能自然语言处理系统之中,但李飞飞有一个新的想法:根据WordNet中的名词构建一个图像数据库,使其中每个名词都与大量包含该名词示例的图像相关联。因此ImageNet的构想诞生了。

2026-09-20 16:05:18

这就像人:想到一定的单词会脑子中显现这个单词的对应的实体的模样,但是局限是抽象的东西AI想象不了,就算现在很多AI能描述一些抽象的东西,那也不过是无意义堆叠的段落或者句子而已,它们要自己学习抽象的东西是非常难的,但如果可以学习到那么离人类智能就不远了。

2026-09-20 16:05:43

如果在谷歌图片搜索中输入“macintosh apple”(麦金塔电脑),你不仅会得到苹果和苹果电脑的相关图片,也会得到苹果形状的蜡烛、智能手机、酒瓶以及其他许多不相关物品的图片

2026-09-20 16:06:01

起初,承担这项任务的主要是本科生

2026-09-20 16:06:04

本书到处充斥的学历歧视😓

2026-09-20 16:06:50

给读中学的才大材小用,大学生是最闲的,消费能力又弱的群体了,随便拿学分吓一下就可以当免费劳动力了

2026-09-20 16:06:43

这活用本科生都大材小用了。显然找几个正在读中学的同学们最合适

2026-09-20 16:06:39

邓嘉的贡献非常大,但在这本书里面,甚至连名字都没有提。建议去看李飞飞写的我眼中的世界。

2026-09-20 16:06:27

但这项任务十分费力且推进得非常缓慢,李飞飞很快意识到:以他们当前的速度,预计需要90年才能完成这项任务4。

2026-09-20 16:06:14

然而,判定一张照片是否与某个特定名词相关,其本质就是目标识别任务本身!并且计算机在这项任务上毫无可靠性可言,而这也正是他们最初想要构建ImageNet的全部原因。

2026-09-20 16:07:22

“亚马逊土耳其机器人”(Amazon Mechanical Turk)。

2026-09-20 16:07:25

土耳其机器人提供的是“一个需要人类智慧的工作市场”

2026-09-20 16:07:29

该服务将请求者与工人连在了一起,其中请求者是指那些需要完成某项难以由计算机完成的任务的人

2026-09-20 16:07:45

而工人是指那些仅收取少量费用(例如,标注图像中的物体,每张照片的报酬是10美分)就愿意将其智慧用于完成请求者所要求的任务的人。

2026-09-20 16:07:55

我公司找的标注团队一张收 0.2 人民币左右,感觉有降价了

2026-09-20 16:08:04

土耳其机器人的出现正体现了明斯基所说的“容易的事情做起来难”,人类被雇用来执行目前对计算机来说仍然很难的“简单”任务。

2026-09-20 16:08:17

土耳其机器人的名字来自一个发生在18世纪的著名的人工智能骗局:原始版本的土耳其机器人是一个玩国际象棋的“智能机器”,其实是一个人秘密地藏在其中来控制木偶下棋,这个木偶即“土耳其机器人”,其穿着打扮就像奥斯曼帝国的苏丹。

2026-09-20 16:08:37

从开国者奥斯曼一世(Osman I,约1299年登基)到最后一位穆罕默德六世(Mehmed VI,1922年被废黜),奥斯曼帝国共经历了36位苏丹的统治。“苏丹”这个头衔也被其他伊斯兰国家使用,如:现代文莱、阿曼、马来西亚柔佛州等仍有苏丹作为国家元首。

所以当我们说”奥斯曼帝国的苏丹”时,指的是一个延续623年的统治职位,由36位不同的男性成员相继担任,他们都来自奥斯曼家族。

2026-09-20 16:08:49

它愚弄了当时的许多知名人士,包括拿破仑·波拿巴。亚马逊的这项服务,其目的不是愚弄任何人,就像最初的土耳其机器人一样,它只是一种“人工的”人工智能5。

2026-09-20 16:08:54

人工智能领域的学术资助提案也往往会包括一个土耳其机器人的专属条目。

2026-09-20 16:09:02

时代的阵痛是难免的,但也会创造出更多的机会,只是对人的要求更高罢了,这也是进化的必然代价

2026-09-20 16:09:27

用廉价人工投喂出来的人工智能,然后再用来替代那些廉价人工的就业岗位。这可真是讽刺!

2026-09-20 16:09:23