本章小结与想一想
模型把特征变成预测,训练则依据目标和数据改变模型。线性回归用加权和,KNN 参考邻居,决策树选择分支,SVM 寻找分类边界,K-means 围绕中心分组,神经网络通过多层运算形成表示。最小二乘、最大似然与贝叶斯方法分别从误差、数据可能性和证据更新的角度指导建模;导数和梯度使参数调整有了可计算的方向。理解 CAICP 中的模型题,不仅要会代入公式,还要看清公式在整个过程中负责什么,以及所得结果能够说明什么。
想一想
1.用直线预测小苗的高度时,有几个观测点没落在线上,这就说明模型用错了吗?比较两条候选直线时,可以怎样利用预测高度与实测高度的差?
2.一个新样本的三个最近邻居,按距离由近到远分别属于红类、蓝类、蓝类。只听最近的一位,和让三位邻居按多数表决,结果会一样吗?这说明邻居数为什么值得选择?
3.桌上的纽扣按位置分组,用每组坐标的平均值作中心。这个中心一定落在某颗纽扣上吗?如果中心移动了,下一轮中有些纽扣为什么可能换组?
4.甲盒有 8 颗红球、2 颗蓝球,乙盒恰好相反。等可能地选一盒,随机摸到一颗红球,却不知道选的是哪盒。这个新线索使哪一盒更值得相信?能因此断定一定选了它吗?
5.有人给神经网络增加了许多层,却去掉所有非线性激活,每层只做加权求和、加上偏置。他说:“层数这么多,弯曲的关系也能学出来。”只增加层数就够了吗?
6.把减小损失想成沿着碗壁走向碗底:方向没有选反,每一步却跨得太大,总是跳到对面。怎样改步长可能更稳?在梯度下降中,哪个设置控制这种步长的大小?
7.模型把练习用的图片越认越准,验证集上的成绩却开始变差。这时继续增加训练轮数,就一定能让它在新图片上表现更好吗?这个反差提醒了什么?
8.图中两个位置出现完全相同的 3×3 像素块,用同一个 3×3 卷积核分别计算,结果会怎样?是否需要为每个位置单独学习一套卷积核参数?