Cpt2: Perceptron & Adaline — Cheatsheet
感知机收敛性:仅当数据线性可分时保证有限步收敛;线性不可分时权重会震荡,需设max_iter。→ TF常考"always converge"陷阱
偏置技巧:$b = -\theta$,令$x_0=1$,决策边界统一写为$\mathbf{w}^\top \mathbf{x} \geq 0$,简化推导
激活函数对比:
- Perceptron:$\text{step}(z) = \begin{cases} +1 & z \geq 0 \ -1 & z < 0 \end{cases}$,输出离散,无梯度
- Adaline:$z = \mathbf{w}^\top \mathbf{x}$,输出连续值,可用MSE求导
误差项本质区别:
- Perceptron更新用$(y - \hat{y})$,$\hat{y} \in {\pm1}$ → 误差只取${0, \pm2}$
- Adaline更新用$(y - z)$,$z \in \mathbb{R}$ → 误差连续,梯度平滑
学习率$\eta$影响:
- $\eta$太小:收敛慢,训练时间长
- $\eta$太大:超调/发散,Loss震荡
- ⚡ 本章算法无自适应$\eta$,需手动调或设衰减
特征缩放必要性(⭐⭐⭐ 高频):
- 若特征量纲差异大(如$x_1 \in [0,10^6], x_2 \in [1,5]$)→ $J(\mathbf{w})$等高线为极扁椭圆
- 梯度方向≠指向最优解 → GD震荡前进,收敛极慢
- 标准化后$\sigma_1'=\sigma_2'=1$ → 等高线变圆 → 梯度直指圆心 → 收敛加速
- ✅ 标准化:$x' = \frac{x-\mu}{\sigma}$;归一化:$x' = \frac{x-x_{\min}}{x_{\max}-x_{\min}}$
Batch vs SGD vs Mini-batch:
- Batch:用全部$n$样本算梯度 → 准、稳,但慢、吃内存
- SGD:每次用1样本 → 快、可跳出局部最优,但震荡大、需$\eta$衰减
- Mini-batch:用$b$样本(32/64)→ 平衡速度+稳定性,深度学习默认
- ⚡ 增大batch size ≠ 总是更好:batch太大→梯度估计准但更新少→收敛慢;batch太小→噪声大→可能发散
线性激活网络等价性(⭐ 高频陷阱):
- 多层线性网络 = 单层线性变换(矩阵乘法可合并)
- 例:$z = W_2(W_1 \mathbf{x}) = (W_2 W_1)\mathbf{x}$ → 等价于单层$W' = W_2 W_1$
- → 非线性激活函数(ReLU/Sigmoid)是深度网络表达力的关键
② 算法流程(应用题自然语言模板)
Perceptron 训练流程
- 初始化权重$\mathbf{w} \leftarrow \mathbf{0}$(或小随机值)
- 对每一轮epoch:
- 遍历每个样本$(\mathbf{x}^{(i)}, y^{(i)})$:
- 计算得分$z = \mathbf{w}^\top \mathbf{x}^{(i)}$
- 预测$\hat{y} = \text{step}(z)$
- 若$\hat{y} \neq y^{(i)}$(分类错误):
- 更新$\mathbf{w} \leftarrow \mathbf{w} + \eta \cdot (y^{(i)} - \hat{y}) \cdot \mathbf{x}^{(i)}$
- 若本轮无错误,提前终止
- 遍历每个样本$(\mathbf{x}^{(i)}, y^{(i)})$:
- 输出最终$\mathbf{w}$
💡 应用题技巧:手动模拟时,注意$(y-\hat{y})$只取${0, \pm2}$;更新方向始终"推"错误样本跨过决策边界
Adaline + Batch GD 流程
- 初始化$\mathbf{w} \leftarrow \mathbf{0}$
- 对每一轮epoch:
- 计算所有样本的预测$z^{(i)} = \mathbf{w}^\top \mathbf{x}^{(i)}$
- 计算梯度$\nabla J(\mathbf{w}) = -\sum_{i=1}^n (y^{(i)} - z^{(i)}) \mathbf{x}^{(i)}$
- 统一更新$\mathbf{w} \leftarrow \mathbf{w} - \eta \cdot \nabla J(\mathbf{w})$
- (可选)计算$J(\mathbf{w}) = \frac{1}{2}\sum_i (y^{(i)} - z^{(i)})^2$监控收敛
- 输出$\mathbf{w}$
💡 应用题技巧:梯度推导见下方模板;注意向量形式$\nabla J = -X^\top(\mathbf{y} - X\mathbf{w})$可快速写答案
特征缩放实操步骤
- 对每个特征$j$:
- 计算均值$\mu_j = \frac{1}{n}\sum_i x_j^{(i)}$
- 计算标准差$\sigma_j = \sqrt{\frac{1}{n}\sum_i (x_j^{(i)} - \mu_j)^2}$
- 标准化$x_j'^{(i)} = \frac{x_j^{(i)} - \mu_j}{\sigma_j}$
- 用$\mathbf{X}'$训练模型
- 预测新样本时,必须用训练集的$\mu_j, \sigma_j$ 做相同变换
⚠️ 易错:测试集不能用自身统计量!必须用训练集参数
③ 数学推导模板(证明题急救包)
模板1:Adaline 梯度推导(⭐⭐⭐ 必背)
已知损失$J(\mathbf{w}) = \frac{1}{2} \sum_{i=1}^n (y^{(i)} - z^{(i)})^2$,其中$z^{(i)} = \mathbf{w}^\top \mathbf{x}^{(i)}$
对单个权重$w_j$求偏导:
$$
\frac{\partial J}{\partial w_j} = \frac{\partial}{\partial w_j} \left[ \frac{1}{2} \sum_i (y^{(i)} - \mathbf{w}^\top \mathbf{x}^{(i)})^2 \right]
= \sum_i (y^{(i)} - z^{(i)}) \cdot \frac{\partial}{\partial w_j} (y^{(i)} - z^{(i)})
$$
$$
= \sum_i (y^{(i)} - z^{(i)}) \cdot (-\frac{\partial z^{(i)}}{\partial w_j})
= \sum_i (y^{(i)} - z^{(i)}) \cdot (-x_j^{(i)})
= -\sum_i (y^{(i)} - \mathbf{w}^\top \mathbf{x}^{(i)}) x_j^{(i)}
$$
向量形式(更简洁,推荐考场写):
$$
\nabla J(\mathbf{w}) = -X^\top (\mathbf{y} - X\mathbf{w})
\quad \Rightarrow \quad
\mathbf{w} \leftarrow \mathbf{w} + \eta X^\top (\mathbf{y} - X\mathbf{w})
$$
💡 链式法则通用:$\frac{\partial J}{\partial \mathbf{w}} = \frac{\partial J}{\partial z} \cdot \frac{\partial z}{\partial \mathbf{w}}$,后续逻辑回归/神经网络同理
模板2:Perceptron 更新合理性证明
目标:解释$\Delta \mathbf{w} = \eta (y - \hat{y}) \mathbf{x}$为何能修正错误
情况1:$y=+1$但$\hat{y}=-1$(漏报)
- 当前$z = \mathbf{w}^\top \mathbf{x} < 0$(因$\hat{y}=-1$)
- 更新后$\mathbf{w}' = \mathbf{w} + \eta \cdot (+1 - (-1)) \cdot \mathbf{x} = \mathbf{w} + 2\eta \mathbf{x}$
- 新得分$z' = \mathbf{w}'^\top \mathbf{x} = z + 2\eta |\mathbf{x}|^2$
- $\because |\mathbf{x}|^2 > 0 \Rightarrow z' > z$,得分被"推高",更可能跨过0阈值 ✓
情况2:$y=-1$但$\hat{y}=+1$(误报)
- 当前$z > 0$,更新$\mathbf{w}' = \mathbf{w} - 2\eta \mathbf{x}$
- $z' = z - 2\eta |\mathbf{x}|^2 < z$,得分被"拉低" ✓
💡 证明题开头先写"目标:修正错误分类",再分情况讨论,逻辑清晰易拿分
模板3:特征缩放加速收敛的数学解释
设两特征$x_1, x_2$,损失$J(\mathbf{w}) = \frac{1}{2} \sum_i (y^{(i)} - w_1 x_1^{(i)} - w_2 x_2^{(i)})^2$
- 若$\text{Var}(x_1) \gg \text{Var}(x_2)$ → $J$对$w_1$变化敏感,对$w_2$迟钝
- 等高线方程:$(w_1 - w_1^)^2 \sigma_1^2 + (w_2 - w_2^)^2 \sigma_2^2 = C$ → 椭圆,长轴沿$w_2$方向
- 梯度$\nabla J$垂直于等高线 → 不指向圆心$(w_1^, w_2^)$ → GD震荡
标准化后$\sigma_1' = \sigma_2' = 1$:
- 等高线变圆:$(w_1 - w_1^)^2 + (w_2 - w_2^)^2 = C$
- 梯度直指圆心 → 直线收敛 ✓
💡 证明题关键:写出等高线方程 + 说明梯度方向与最优方向夹角
模板4:线性激活网络等价性证明
设两层线性网络:
$$
\mathbf{h} = W_1 \mathbf{x}, \quad \mathbf{z} = W_2 \mathbf{h} = W_2 (W_1 \mathbf{x}) = (W_2 W_1) \mathbf{x}
$$
令$W' = W_2 W_1$,则$\mathbf{z} = W' \mathbf{x}$,等价于单层线性变换 ✓
💡 推论:深度网络必须用非线性激活函数,否则层数无意义(高频陷阱题)
⚠️ 高频易错点速记
- 熵计算:$\log$底数=2(信息论默认),$0 \cdot \log 0 = 0$(极限定义)
- 信息增益权重:$H(D_v)$前必须乘$\frac{|D_v|}{|D|}$,漏乘必错
- K-NN偏差-方差:$k \uparrow \Rightarrow$ 决策边界平滑 $\Rightarrow$ bias$\uparrow$, variance$\downarrow$(画图记:k=1锯齿,k=n直线)
- 正则化几何解释:
- L1:$|\mathbf{w}|_1 \leq C$为菱形,等高线易碰角点 → 稀疏解
- L2:$|\mathbf{w}|_2 \leq C$为圆,等高线碰边缘 → 权重收缩
- ROC曲线:纵轴TPR=$\frac{TP}{TP+FN}$,横轴FPR=$\frac{FP}{FP+TN}$;阈值↓ → TPR↑, FPR↑ → 曲线右上走
💡 证明题赖皮大法(考场保命)
看到"证明更新规则等价于最小化J" → 立即写:
- 目标函数$J = \cdots$
- 对参数求偏导$\frac{\partial J}{\partial \theta} = \cdots$
- 令梯度=0解出$\theta^* = \cdots$,对比算法更新式
看到"推导梯度" → 立即写:
- 链式法则框架:$\frac{\partial J}{\partial w} = \frac{\partial J}{\partial z} \cdot \frac{\partial z}{\partial w}$
- 逐层代入,最后整理成$(\text{error}) \cdot (\text{input})$形式
看到"信息增益计算" → 立即写:
- $Gain = H(\text{parent}) - \sum_v \frac{|D_v|}{|D|} H(D_v)$
- 先算父节点熵,再算各子节点熵×权重,最后相减
卡住时:先写已知公式 + 目标形式,中间步骤留空,最后补关键等式,通常能拿步骤分
Cpt3: Logistic Regression / SVM / KNN — Cheatsheet
① 概念直觉(TF/MCQ 高频考点)
Logistic Regression 本质:
- 判别式模型,直接建模 $P(y=1|\mathbf{x};\mathbf{w}) = \sigma(\mathbf{w}^\top \mathbf{x})$,$\sigma(z) = \frac{1}{1+e^{-z}}$
- 输出是概率,非硬分类;预测时通常阈值0.5二值化
- ✅ 等价于单层神经网络 + sigmoid激活 + cross-entropy损失 → pp2-P1 Q7
Sigmoid 关键性质:
- 导数:$\sigma'(z) = \sigma(z)(1-\sigma(z))$ → 当$|z|$大时梯度→0(梯度消失)
- 输出范围$(0,1)$,对称中心$\sigma(0)=0.5$
- ⚡ 与tanh对比:tanh输出$(-1,1)$,0中心化,收敛略快
Cross-Entropy vs MSE for 分类:
- CE损失:$J = -[y \log \sigma + (1-y)\log(1-\sigma)]$
- 梯度:$\frac{\partial J}{\partial \mathbf{w}} = (\sigma - y)\mathbf{x}$(简洁!)
- MSE梯度:$(\sigma - y) \cdot \sigma(1-\sigma) \cdot \mathbf{x}$ → 多一项$\sigma(1-\sigma)$,当$\sigma$接近0/1时梯度消失
- ✅ CE对分类任务更友好,梯度信号强
SVM 最大间隔直觉:
- 目标:找超平面$\mathbf{w}^\top \mathbf{x} + b = 0$,使最近样本到平面距离最大
- 几何间隔 = $\frac{y(\mathbf{w}^\top \mathbf{x} + b)}{|\mathbf{w}|}$,最大化最小几何间隔 ⇔ 最小化$\frac{1}{2}|\mathbf{w}|^2$
- 约束:$y^{(i)}(\mathbf{w}^\top \mathbf{x}^{(i)} + b) \geq 1$(函数间隔≥1)
Hinge Loss 与 0-1 Loss:
- 0-1 loss:$\mathbb{I}(y \neq \hat{y})$,非凸、不可导,难优化
- Hinge loss:$\max(0, 1 - y(\mathbf{w}^\top \mathbf{x} + b))$,凸代理,可导(次梯度)
- 当$y z \geq 1$时loss=0(正确分类且间隔足够),否则线性惩罚
支持向量:
- 满足$0 < \alpha_i < C$的样本(对偶变量),位于间隔边界上
- 决定决策边界:$\mathbf{w} = \sum_i \alpha_i y^{(i)} \mathbf{x}^{(i)}$,仅支持向量贡献
- ⚡ 测试时只需计算与支持向量的内积,高效
软间隔与Slack变量:
- 允许部分样本违反间隔:$y^{(i)}(\mathbf{w}^\top \mathbf{x}^{(i)} + b) \geq 1 - \xi_i, \xi_i \geq 0$
- 目标:$\min \frac{1}{2}|\mathbf{w}|^2 + C \sum_i \xi_i$,$C$大→硬间隔(不容错),$C$小→软间隔(容错强)
- ⚠️ $C$是正则化强度的倒数:$C \uparrow$ → 正则化$\downarrow$ → 易过拟合
核方法直觉:
- 低维线性不可分 → 映射到高维$\phi(\mathbf{x})$ → 高维线性可分
- 核技巧:$K(\mathbf{x},\mathbf{x}') = \phi(\mathbf{x})^\top \phi(\mathbf{x}')$,避免显式计算$\phi$
- 常用核:Linear, Polynomial $(\gamma \mathbf{x}^\top \mathbf{x}' + r)^d$, RBF $\exp(-\gamma |\mathbf{x}-\mathbf{x}'|^2)$
- ⚡ RBF核$\gamma$大→每个样本影响范围小→决策边界复杂→易过拟合
KNN 核心特性:
- 惰性学习(lazy):无显式训练,预测时才计算
- 距离度量:Euclidean $|\mathbf{x}-\mathbf{x}'|_2$(默认), Manhattan $|\cdot|_1$, Minkowski $|\cdot|_p$
- k值影响(⭐⭐⭐ 高频):
- $k=1$:决策边界锯齿状,variance高,bias低 → 易过拟合
- $k=n$:全局多数投票,boundary平滑,bias高,variance低 → 易欠拟合
- ✅ 选k:交叉验证,通常奇数防平票
KNN 留一法CV(LOOCV):
- 对每个样本$i$:用其余$n-1$点训练,预测$i$,计算误差
- 1-NN LOOCV误差 = $\frac{1}{n} \sum_i \mathbb{I}(\text{nearest neighbor of } i \text{ has different label})$
- ⚡ 注意:找近邻时排除自身,否则1-NN训练误差恒为0(平凡解)
类别不平衡时KNN:
- 多数类主导投票 → 少数类召回率低
- 解决:① 加权投票(距离倒数权重)② 欠采样多数类 ③ 用F1/ROC-AUC评估
② 算法流程(应用题自然语言模板)
Logistic Regression 训练流程
- 初始化权重$\mathbf{w} \leftarrow \mathbf{0}$(或小随机值),设学习率$\eta$
- 对每轮epoch:
- 对每个样本$(\mathbf{x}^{(i)}, y^{(i)})$:
- 计算线性得分$z^{(i)} = \mathbf{w}^\top \mathbf{x}^{(i)}$
- 计算概率$\sigma^{(i)} = \frac{1}{1+e^{-z^{(i)}}}$
- 计算梯度$\nabla J^{(i)} = (\sigma^{(i)} - y^{(i)}) \mathbf{x}^{(i)}$
- (Batch GD)汇总梯度:$\nabla J = \frac{1}{n} \sum_i \nabla J^{(i)}$
- 更新权重:$\mathbf{w} \leftarrow \mathbf{w} - \eta \nabla J$
- 对每个样本$(\mathbf{x}^{(i)}, y^{(i)})$:
- 预测新样本:计算$\sigma(\mathbf{w}^\top \mathbf{x})$,若$\geq 0.5$则预测+1
💡 应用题技巧:梯度形式$(\sigma-y)\mathbf{x}$与Adaline$(z-y)\mathbf{x}$结构一致,仅激活函数不同
SVM 训练流程(对偶问题直觉)
- 构造QP问题:
- 目标:$\min_{\boldsymbol{\alpha}} \frac{1}{2} \sum_{i,j} \alpha_i \alpha_j y_i y_j K(\mathbf{x}_i, \mathbf{x}_j) - \sum_i \alpha_i$
- 约束:$0 \leq \alpha_i \leq C$, $\sum_i \alpha_i y_i = 0$
- 用SMO等算法解出$\alpha_i$
- 计算$\mathbf{w} = \sum_i \alpha_i y_i \mathbf{x}_i$(仅支持向量$\alpha_i>0$贡献)
- 计算$b$:任选支持向量$(\mathbf{x}_s, y_s)$,$b = y_s - \mathbf{w}^\top \mathbf{x}_s$
- 预测:$f(\mathbf{x}) = \text{sign}(\sum_i \alpha_i y_i K(\mathbf{x}_i, \mathbf{x}) + b)$
💡 应用题技巧:线性核时$K(\mathbf{x}_i,\mathbf{x}) = \mathbf{x}_i^\top \mathbf{x}$;RBF核需记$\exp(-\gamma |\mathbf{x}_i-\mathbf{x}|^2)$
KNN 预测流程
- 存储全部训练数据${(\mathbf{x}^{(i)}, y^{(i)})}_{i=1}^n$(无训练阶段)
- 对新样本$\mathbf{x}_{\text{test}}$:
- 计算与所有训练点的距离$d_i = |\mathbf{x}_{\text{test}} - \mathbf{x}^{(i)}|$
- 找距离最小的$k$个点(k近邻)
- 统计$k$近邻中各类别票数,预测票数最多的类
- (可选)加权投票:权重$= 1/d_i$或$1/d_i^2$
- 输出预测标签
💡 应用题技巧:手动计算时注意距离公式;k值影响决策边界形状(画图辅助)
特征缩放对KNN/SVM的影响
- KNN依赖距离度量:若特征量纲差异大,大尺度特征主导距离 → 需标准化
- SVM间隔$\propto 1/|\mathbf{w}|$:特征尺度不一→$\mathbf{w}$各维度权重不可比 → 需标准化
- ✅ 统一用训练集$\mu,\sigma$标准化测试数据
③ 数学推导模板(证明题急救包)
模板1:Logistic Regression 梯度推导(⭐⭐⭐ 必背)
损失函数(单样本):
$$
J(\mathbf{w}) = - \left[ y \log \sigma(z) + (1-y) \log(1-\sigma(z)) \right], \quad z = \mathbf{w}^\top \mathbf{x}
$$
链式法则:
$$
\frac{\partial J}{\partial \mathbf{w}} = \frac{\partial J}{\partial \sigma} \cdot \frac{\partial \sigma}{\partial z} \cdot \frac{\partial z}{\partial \mathbf{w}}
$$
逐层计算:
$$
\frac{\partial J}{\partial \sigma} = -\left[ \frac{y}{\sigma} - \frac{1-y}{1-\sigma} \right] = \frac{\sigma - y}{\sigma(1-\sigma)}
$$
$$
\frac{\partial \sigma}{\partial z} = \sigma(1-\sigma) \quad \text{(sigmoid导数)}
$$
$$
\frac{\partial z}{\partial \mathbf{w}} = \mathbf{x}
$$
相乘消去$\sigma(1-\sigma)$:
$$
\frac{\partial J}{\partial \mathbf{w}} = \frac{\sigma - y}{\sigma(1-\sigma)} \cdot \sigma(1-\sigma) \cdot \mathbf{x} = (\sigma - y) \mathbf{x} \quad \checkmark
$$
💡 关键:$\sigma(1-\sigma)$项恰好消去,梯度简洁!多样本时取平均
模板2:SVM 最大间隔 ⇔ 最小化‖w‖²
目标:最大化最小几何间隔$\gamma = \min_i \frac{y^{(i)}(\mathbf{w}^\top \mathbf{x}^{(i)} + b)}{|\mathbf{w}|}$
等价变换:
- 固定函数间隔为1(缩放$\mathbf{w},b$不影响超平面):$y^{(i)}(\mathbf{w}^\top \mathbf{x}^{(i)} + b) \geq 1$
- 几何间隔 = $1/|\mathbf{w}|$,最大化$1/|\mathbf{w}|$ ⇔ 最小化$|\mathbf{w}|$
- 为方便求导,最小化$\frac{1}{2}|\mathbf{w}|^2$(凸函数,最优解相同)
最终QP形式:
$$
\min_{\mathbf{w},b} \frac{1}{2} |\mathbf{w}|^2 \quad \text{s.t.} \quad y^{(i)}(\mathbf{w}^\top \mathbf{x}^{(i)} + b) \geq 1, \forall i
$$
💡 证明题开头先写"目标:max margin ⇔ min ‖w‖",逻辑清晰
模板3:Hinge Loss 次梯度推导
Hinge loss:$\ell(z) = \max(0, 1 - y z)$, $z = \mathbf{w}^\top \mathbf{x} + b$
次梯度(因max函数在$1-yz=0$处不可导):
$$
\frac{\partial \ell}{\partial \mathbf{w}} =
\begin{cases}
-y \mathbf{x} & \text{if } y z < 1 \quad \text{(违反间隔)} \
0 & \text{if } y z > 1 \quad \text{(满足间隔)} \
\text{任意} \in [-y\mathbf{x}, 0] & \text{if } y z = 1
\end{cases}
$$
💡 应用:SGD更新时,仅对$yz<1$的样本更新$\mathbf{w} \leftarrow \mathbf{w} + \eta y \mathbf{x}$
模板4:KNN LOOCV 误差计算(1-NN特例)
对每个样本$i$:
- 临时移除$(\mathbf{x}^{(i)}, y^{(i)})$
- 在剩余$n-1$点中找$\mathbf{x}^{(i)}$的最近邻$\mathbf{x}^{(j)}$
- 若$y^{(j)} \neq y^{(i)}$,则$i$被误分类
- LOOCV误差 = $\frac{1}{n} \sum_{i=1}^n \mathbb{I}(y^{(j)} \neq y^{(i)})$
💡 真题技巧:pp2-P4 Q1 XNOR数据集,1-NN LOOCV误差=0.5(每个点的最近邻标签相反)
模板5:SVM 软间隔 约束与目标
Primal problem with slack variables:
$$
\min_{\mathbf{w},b,\boldsymbol{\xi}} \frac{1}{2} |\mathbf{w}|^2 + C \sum_{i=1}^n \xi_i
$$
$$
\text{s.t.} \quad y^{(i)}(\mathbf{w}^\top \mathbf{x}^{(i)} + b) \geq 1 - \xi_i, \quad \xi_i \geq 0, \quad \forall i
$$
- $\xi_i = 0$:样本在间隔外或边界上(正确分类)
- $0 < \xi_i \leq 1$:样本在间隔内但分类正确
- $\xi_i > 1$:样本被误分类
- $C$控制tradeoff:$C \to \infty$ → 硬间隔;$C \to 0$ → 忽略间隔,只最小化误分类
💡 证明题:若问"为什么用$\frac{1}{2}|\mathbf{w}|^2$" → 答:凸、可导、最优解相同
⚠️ 高频易错点速记
- LR梯度符号:是$(\sigma - y)\mathbf{x}$,不是$(y - \sigma)$!记"预测减真实"
- SVM约束方向:$y(\mathbf{w}^\top \mathbf{x}+b) \geq 1$,不是$\leq$!$y$已编码±1
- KNN距离计算:留一法时必须排除自身,否则1-NN训练误差恒为0(陷阱题)
- 核参数$\gamma$:RBF核$\exp(-\gamma |\mathbf{x}-\mathbf{x}'|^2)$,$\gamma$大→影响范围小→模型复杂
- 正则化$C$:SVM中$C$是误差惩罚系数,$C \uparrow$ → 正则化$\downarrow$ → 易过拟合(与LR的$\lambda$相反!)
- ROC坐标:纵轴TPR=$\frac{TP}{TP+FN}$,横轴FPR=$\frac{FP}{FP+TN}$;阈值↓ → 曲线向右上移动
- 信息增益权重:$H(D_v)$前乘$\frac{|D_v|}{|D|}$,漏乘必错(虽属决策树,但熵计算通用)
💡 证明题赖皮大法(考场保命)
看到"推导逻辑回归梯度" → 立即写:
- $J = -[y \log \sigma + (1-y)\log(1-\sigma)]$
- Chain rule: $\frac{\partial J}{\partial \mathbf{w}} = \frac{\partial J}{\partial \sigma} \cdot \frac{\partial \sigma}{\partial z} \cdot \frac{\partial z}{\partial \mathbf{w}}$
- 代入$\frac{\partial J}{\partial \sigma} = \frac{\sigma-y}{\sigma(1-\sigma)}$, $\frac{\partial \sigma}{\partial z} = \sigma(1-\sigma)$ → 消去得$(\sigma-y)\mathbf{x}$
看到"SVM最大间隔证明" → 立即写:
- 几何间隔 = $\frac{y(\mathbf{w}^\top \mathbf{x}+b)}{|\mathbf{w}|}$
- 固定函数间隔=1 → max margin ⇔ 最小化 $\frac{1}{2}|\mathbf{w}|^2$
- 约束:$y(\mathbf{w}^\top \mathbf{x}+b) \geq 1$
看到"KNN k值影响" → 立即写:
- $k \uparrow$ → 决策边界平滑 → bias$\uparrow$, variance$\downarrow$
- $k \downarrow$ → 边界锯齿 → bias$\downarrow$, variance$\uparrow$
- 画图:k=1(过拟合), k=n(欠拟合), 中间最优
卡住时:先写目标函数 + 关键约束,中间步骤留空,最后补结论,通常能拿步骤分