AI中学生 CAICP 学习指南

本章小结与想一想

机器学习的任务由目标决定,学习方式由可用的数据和反馈决定。训练、验证与测试分工明确,预处理沿用一致规则,评价对应实际用途,模型结果才有清楚的含义。CAICP 中有关学习过程和效果判断的问题,往往正是要求辨认这些关系。后面介绍线性回归、分类器和神经网络时,将进一步打开模型内部,观察输入怎样变成预测,以及训练怎样改变这一计算过程。

想一想

1.图书馆想让模型回答两个问题:“这本书会不会逾期归还?”和“它还要几天归还?”前一个要选类别,后一个要报数值。这会怎样影响任务的设置和检查结果的方式?

2.把一盒纽扣交给程序,让它按相似程度分成几堆,却不事先告诉它每颗纽扣属于哪一类。这样的学习需要现成的类别答案吗?分出的堆就一定是人们想要的分类吗?

3.把同一张照片复制十份,再随机放进训练集和测试集,模型的成绩可能很好看。为什么这还不能证明它能识别没见过的照片?划分数据时应该怎样处理这些重复材料?

4.一份表同时记录身高和年龄。把身高从厘米改成毫米,人并没有长高,可按两列数值计算的距离却可能明显改变。为什么换个单位也会影响结果?预处理可以怎样帮助比较?

5.为了增加训练图片,小林把一张“6”旋转,结果看起来成了“9”,却仍保留原来的标签“6”。这次数据增强哪里出了问题?变换图片时,除了清晰度,还要检查什么?

6.100 个苹果中有 98 个好苹果、2 个坏苹果。模型把它们全部判断为好苹果,准确率就有 98%。把它放到专门挑出坏苹果的岗位上,表现真的好吗?它漏掉了什么?

发现错误或有没讲清楚的地方?欢迎提交勘误与建议。请注明章节及原文。

↑