机器学习笔记
1.机器学习分类
机器学习大致分为 监督学习,无监督学习两类

2.线性回归模型
真实值 预测值
在线性回归中,(f_{w,b}(x)) 就是预测值 (\hat{y}),两者表示相同的含义,即:
[ \hat{y}=f_{w,b}(x)=wx+b ]
其中,(x) 是输入特征,(w) 是权重或斜率,(b) 是偏置或截距;(\hat{y}) 表示模型计算出的预测值,(y) 表示数据中的真实值。因此,模型的预测误差可以写成:
[ \hat{y}-y=f_{w,b}(x)-y ]
线性回归的目标是不断调整参数 (w) 和 (b),使预测值 (\hat{y}) 尽可能接近真实值 (y),从而减小代价函数 (J(w,b))。
线性回归的代价函数 (J(w,b))
在线性回归中,模型的预测函数为:
[ f_{w,b}(x^{(i)})=wx^{(i)}+b ]
其中,(w) 表示直线的斜率,(b) 表示截距,(x^{(i)}) 表示第 (i) 个样本的输入,(y^{(i)}) 表示该样本的真实值。
为了衡量模型预测值与真实值之间的差距,通常使用平方误差代价函数:
[ J(w,b)=\frac{1}{2m}\sum_{i=1}^{m}\left(f_{w,b}(x^{(i)})-y^{(i)}\right)^2 ]
把预测函数代入后,可以写成:
[ J(w,b)=\frac{1}{2m}\sum_{i=1}^{m}\left(wx^{(i)}+b-y^{(i)}\right)^2 ]
其中:
- (m):训练样本的数量;
- (f_{w,b}(x^{(i)})):模型对第 (i) 个样本的预测值;
- (y^{(i)}):第 (i) 个样本的真实值;
- (f_{w,b}(x^{(i)})-y^{(i)}):预测误差;
- (J(w,b)):所有训练样本的平均误差,用来评价模型的拟合效果。
公式中的误差需要平方,这样可以避免正负误差相互抵消,同时会让较大的误差受到更明显的惩罚。分母中的 (2) 是为了在求导时抵消平方产生的系数,使后续计算更加简洁,不会影响代价函数最小值所在的位置。
线性回归训练的目标是寻找合适的 (w) 和 (b),使代价函数尽可能小:
[ \min_{w,b}J(w,b) ]
(J(w,b)) 越小,说明预测值越接近真实值,模型的拟合效果通常越好。梯度下降算法就是通过不断调整 (w) 和 (b),逐步找到使 (J(w,b)) 最小的参数。




