B 术语与符号表
数据、任务与评价
| 术语 | 含义 | 主要位置 |
|---|---|---|
| 样本、特征、标签 | 一条处理对象记录、用于计算的信息、要预测的目标 | 1.2、5.1 |
| 模态 | 文字、图像、声音等内容形式 | 1.2 |
| 参数、超参数 | 训练中学习的量,以及规定结构和训练方式的设置 | 5.2 |
| 训练、推理 | 从材料中学习模型,以及使用模型计算结果 | 1.1、5.2 |
| 泛化 | 对未用于训练的新情况仍然有效的能力 | 1.1、6.7 |
| 分类、回归、聚类 | 预测类别、预测数量、按相似性发现分组 | 5.1 |
| 监督、非监督、半监督 | 使用目标标签、不使用目标标签、结合有标签与无标签数据 | 5.1 |
| 强化学习、策略 | 通过交互学习行动,以及状态下选择动作的规则 | 5.1 |
| 训练集、验证集、测试集 | 分别用于学习、选择方案和独立评价的材料 | 5.2 |
| 数据泄漏 | 本应不可用于学习或选择的信息提前进入开发过程 | 5.3 |
| 分布变化 | 新数据与已有数据在构成或规律上的差别 | 5.2 |
| 标准化 | 常指减去训练均值后除以训练标准差 | 5.3 |
| 归一化 | 一类尺度变换名称,需结合具体公式理解 | 5.3 |
| 独热编码、嵌入 | 类别指示向量,以及由映射获得的数值表示 | 5.3 |
| 准确率、精确率、召回率 | 全部判断的正确比例、预测正类中实际为正的比例、实际正类中被找出的比例 | 5.4 |
| TP、FP、FN、TN | 真正例、假正例、假负例、真负例 | 5.4 |
| MAE、MSE、RMSE | 平均绝对误差、均方误差、均方根误差 | 3.2、5.4 |
算法、模型与工具
| 术语 | 含义 | 主要位置 |
|---|---|---|
| 枚举、二分查找 | 逐一检查候选,以及借助有序性反复缩小范围 | 4.2 |
| 贪心、分治 | 按局部规则选择,以及分解成较小同类问题求解 | 4.3 |
| 顶点、边、路径 | 图中的对象、连接关系、沿连接行进的序列 | 4.4 |
| BFS、DFS | 广度优先搜索、深度优先搜索 | 4.4 |
| 队列、栈 | 先进先出、后进先出的数据组织方式 | 4.4 |
| 状态、状态转换 | 为后续变化保留的信息,以及动作引起的改变 | 4.5 |
| 正反馈、负反馈 | 加强原变化、抵消原变化的反馈作用 | 4.5 |
| 决策函数、损失函数 | 产生分类依据,以及评价预测与目标的差距 | 6.1—6.2 |
| 最小二乘、最大似然 | 最小化平方误差,以及最大化已观察数据的似然 | 6.1、6.4 |
| 先验、后验 | 观察证据前的概率,与结合证据后的条件概率 | 6.4 |
| KNN、K-means | 参考 K 个邻居,以及划分为 K 个均值簇 | 6.2—6.3 |
| SVM、MLP、CNN | 支持向量机、多层感知机、卷积神经网络 | 6.2、6.5、6.8 |
| 激活函数 | 将神经元加权结果转换为输出的函数 | 6.5 |
| 前向传播、反向传播 | 逐层得到预测,以及反向计算损失的梯度 | 6.5 |
| 导数、偏导数、梯度 | 单变量变化率、固定其他变量的变化率、各偏导组成的向量 | 6.6 |
| 学习率、批大小、epoch | 更新比例、每批样本数、完整处理训练集一遍 | 6.6—6.7 |
| 正则化、早停 | 对拟合施加额外偏好,以及按验证表现停止训练 | 6.7 |
| 卷积核、步幅、填充 | 局部权重、窗口移动距离、边缘补数 | 6.8 |
| 通道、特征图、池化 | 同一位置的不同信息分量、局部运算输出、窗口汇总 | 6.8 |
| ndarray、DataFrame | NumPy 多维数组、Pandas 表格对象 | 7.1—7.2 |
| 广播、视图 | 按形状规则配合运算、与原数组共享数据的表示 | 7.1 |
| fit、transform、predict | 学习规则、按已有规则变换、计算预测 | 7.4 |
| token、注意力、Transformer | 文本片段、上下文加权机制、以注意力为核心的网络架构 | 8.1 |
| 世界模型、具身智能 | 预测环境与行动后果,以及通过行动与环境交互 | 8.1 |
常见符号
符号不是固定不变的名字。同一个字母在不同公式中可能表示不同量,读取时应以紧邻公式的定义为准。例如,\(p\) 在概率公式中常表示概率,在卷积尺寸公式中则用来表示填充格数。
| 符号 | 常见含义 | 需要区分的地方 |
|---|---|---|
| \(x_i\)、\(x^2\) | 第 i 项、x 的平方 | 下标是编号,上标常表示乘方 |
| \(\hat{y}\)、\(y\) | 预测值、真实目标值 | 误差通常由前者减后者 |
| \(\bar{x}\) | 一组数的平均值 | 不是任意单个样本 |
| \(\sum\) | 按给定范围逐项相加 | 先读下标起点和上标终点 |
| \(P(A\mid B)\) | 已知 B 时 A 的条件概率 | 条件写在竖线右边 |
| \(w\)、\(b\) | 权重、偏置 | 是模型的计算设置,不是样本标签 |
| \(\mu\)、\(\sigma\) | 均值、标准差 | K-means 中均值符号也可表示簇中心 |
| \(f'(x)\) | 函数的导数 | 描述局部变化率 |
| \(\nabla L\) | 损失函数的梯度 | 梯度方向上升,更新常沿负梯度 |
| \(\eta\)、\(\lambda\) | 学习率、正则化强度 | 不同工具可能使用其他名称 |
| \(O(n)\)、\(O(n^2)\) | 操作次数随规模增长的数量级 | 不是精确秒数 |
.shape、axis |
数组形状、指定操作轴 | 数组轴数与每个样本特征数不同 |