1.4 人工智能的发展与主要思想
1956 年,一批研究者在美国达特茅斯开展了以人工智能为主题的夏季研究活动。此前一年,约翰·麦卡锡等人提出研究计划,并在计划中使用了“人工智能”这个名称。这次活动通常被视为人工智能成为独立研究领域的重要起点。研究者希望机器具有智能,但对实现方法有不同想法:有人从知识和推理出发,有人借鉴神经元之间的连接,还有人关注机器怎样在环境中行动。这些思路逐渐形成了符号主义、联结主义和行为主义等研究方向,后来也常在同一个系统中结合使用。
用知识和规则推导结论
符号主义重视把知识写成符号和规则,再逐步推导结论。系统若知道“麻雀是鸟”“所有鸟都是动物”,便能推出“麻雀是动物”。专家系统把这类办法用于特定领域:将知识整理为规则,从输入事实找到适用规则,推得的新结论还可以继续参与推理。设备维护系统就可以联系故障现象、传感器读数与检查规则,判断下一步该检查哪个部件。这样的推理有时能清楚交代结论是怎样来的,但规则本身也得可靠。若保存的是“所有鸟都会飞”,推理步骤即使没有错,遇到企鹅仍会出问题。现实知识有条件、例外和冲突,任务范围越广,整理和维护这些知识就越困难。
早期人工智能还广泛研究搜索,也就是按照一定的方法考察可能的选择。下一步棋会形成新局面,对方的回应又会形成更多局面,继续往后想,就像一棵树不断分出枝条。计算机可以搜索这些分支,用评价方法判断哪些局面更有利。1997 年,IBM 的“深蓝”在六局国际象棋对抗赛中以总比分击败当时的世界冠军卡斯帕罗夫。它把强大的局面搜索能力与棋局评价方法结合起来,在规则明确、变化很多的任务中取得了成功。
从感知机到神经网络
联结主义关注相互连接的计算单元。生物大脑中神经元之间的大量连接启发了研究者:许多简单单元能否共同完成复杂任务?人工神经网络由此发展,不过人工神经元是简化的数学模型。20 世纪 50 年代后期,弗兰克·罗森布拉特研究了感知机。它把多个输入分别乘以权重、合在一起,再作判断,并通过学习调整权重。数值同为 5,乘以 2 得到 10,乘以 0.5 得到 2.5,可见权重能改变一个输入对结果的影响。简单感知机所能表示的判断关系有限,将多个计算层连接起来,上一层的输出便能交给下一层继续处理,表示更复杂的关系。由较多层构成的神经网络是深度学习的主要研究对象。图像中的像素经过多层计算,会逐步形成适合判断对象的信息;各层怎样处理、哪些信息分量更大,需要在训练中调整。
层数多,并不等于一开始就会识别。合适的数据、训练方法和计算资源仍然缺一不可。
ImageNet 是一个大规模、有类别组织的图像数据库,相关论文发表于 2009 年。它为视觉研究提供了丰富的学习材料,也让不同方法能够在共同的任务中比较表现。2012 年,后来被广泛称为 AlexNet 的深度卷积神经网络在 ImageNet 图像识别挑战中取得显著成绩。卷积神经网络是一类适合处理图像等数据的神经网络,具体原理将在后面的章节介绍。这里先分清两者的角色:ImageNet 提供图片,AlexNet 是识别模型,GPU 提供了重要的计算支持。这次进展再次体现了数据、算法和算力的配合。
从行动的结果中学习
行为主义关注机器在环境中的感知和行动。能观察环境并采取行动的系统,常称为智能体。机器人读取传感器,发现障碍就转向,移动后再观察,决定下一步怎么走,便形成了持续交互。如果它始终照预定规则转向,交互中未必发生学习;如果还能根据走过的路线和遇到的障碍,改善以后的行动方式,就涉及从经验中学习。
强化学习研究的正是怎样利用行动后的反馈学会更好的策略,也就是学会在不同情况下选择怎样行动。
2016 年,AlphaGo 在与李世石的五局围棋比赛中以 4 比 1 获胜,它结合了神经网络、搜索和强化学习等技术。围棋的可能局面太多,很难把每一种后续走法都算完。AlphaGo 利用学习得到的判断,优先考虑更有希望的方向,再通过搜索分析落子之后的变化。学习与搜索在这里相互帮助,也说明人工智能的不同研究思路可以共同解决一个问题。
机器的语言表现与理解
1950 年,艾伦·图灵在《计算机器与智能》中提出用模仿游戏讨论机器智能。通常所说的图灵测试,让判断者只通过文字交流,分辨另一端是人还是机器。看不到外貌、听不到声音,只能依据交流内容判断,机器的语言表现由此成了可以观察和讨论的对象。
但是,回答得合适,是否就说明理解了意思?哲学家约翰·塞尔在 1980 年提出了中文屋子思想实验。设想一个完全不懂中文的人待在房间里,收到中文符号后,照一本规则手册查找,再把规定的符号送出去。屋外的人也许觉得回答很流利,屋里的人却不知道这些符号是什么意思。所谓思想实验,不一定真要建一间屋子,而是借一种设想追问概念中的困难。塞尔由此讨论,正确操作符号是否足以构成理解。人们对这套论证仍有争议,它没有为机器理解的问题给出一个公认答案。
2022 年 11 月 30 日,OpenAI 发布 ChatGPT 的研究预览,大量公众开始通过对话接触基于大语言模型的系统。大语言模型利用大量语言数据,学习词语、句子和上下文中的联系,并经过进一步训练形成对话能力。它们能生成连贯文字,也把机器理解的问题带到了人们面前。图灵关注交谈中的表现,塞尔追问符号与理解的关系,语言模型则提供了新的技术实例。讨论这些问题,有助于更仔细地区分机器做到了什么,以及还不能仅凭表现断定什么。
表 1-3 人工智能发展的部分重要事件
| 时间 | 事件或工作 | 主要意义 |
|---|---|---|
| 1950 年 | 图灵提出模仿游戏的讨论 | 从可观察行为研究机器智能 |
| 1956 年 | 达特茅斯夏季研究活动 | 人工智能形成独立研究领域的重要起点 |
| 20 世纪 50 年代后期 | 感知机研究 | 通过数据调整参数,学习判断规则 |
| 1980 年 | 中文屋子思想实验 | 讨论符号处理与语言理解的关系 |
| 1997 年 | 深蓝击败卡斯帕罗夫 | 搜索和局面评价在复杂任务中取得突破 |
| 2009 年 | ImageNet 论文发表 | 大规模图像数据为视觉研究提供学习材料 |
| 2012 年 | AlexNet 取得突破 | 深层网络与 GPU 计算提升图像识别表现 |
| 2016 年 | AlphaGo 击败李世石 | 学习与搜索方法相互配合 |
| 2022 年 | ChatGPT 研究预览发布 | 对话系统使语言模型进入公众视野 |