AI中学生 CAICP 学习指南

本章小结与想一想

NumPy 按形状组织数值计算,Pandas 按字段处理表格,Matplotlib 把关系画出来,scikit-learn 将模型与处理步骤连接成可运行的学习流程。工具调用中的每一步,都能回接到前面已经学过的概念:按轴求均值、保持特征顺序、只从训练材料学习处理规则、用独立数据评价。CAICP 中需要阅读或补全库代码时,先判断数据形状和每步作用,再查明参数与输出含义,就能够逐渐把陌生接口还原成清楚的计算过程。

想一想

1.训练模型时,每株植物用四个特征表示。现在只有一株新植物,把它整理成形状 (1, 4) 和 (4, 1) 的数组,是同一回事吗?模型会把哪一维当作样本数?

2.三株植物的高度和叶宽排成三行两列。对这个数组使用 mean(axis=0),会得到两个数还是三个数?它们分别在求谁的平均值?

3.一张表记录学号和姓名,另一张表记录学号和借书数,两张表的行顺序不同。若按第一行对第一行直接拼起来,会发生什么?应该用什么把同一个人的记录对上?

4.天气表中,有一天的降水量写着 0,另一天没有记录。它们都表示“没下雨”吗?如果把所有空格都填成 0,后面的统计会把什么误当成已经知道的事实?

5.要看一周气温怎样变化,又想看一批植物的高度与叶片数有没有关系。这两件事分别适合用什么图?各选一种,并说清楚横轴和纵轴放什么。

6.模型训练前做过标准化。预测新植物时,若把原始数值直接交给模型,会漏掉哪一步?能只根据这一株植物重新学习一套标准化规则吗?为什么应沿用训练时的处理流程?

发现错误或有没讲清楚的地方?欢迎提交勘误与建议。请注明章节及原文。

↑