1.机器学习分类

机器学习大致分为 监督学习,无监督学习两类

image-20260916202430230

2.线性回归模型

真实值 预测值

在线性回归中,(f_{w,b}(x)) 就是预测值 (\hat{y}),两者表示相同的含义,即:

[ \hat{y}=f_{w,b}(x)=wx+b ]

其中,(x) 是输入特征,(w) 是权重或斜率,(b) 是偏置或截距;(\hat{y}) 表示模型计算出的预测值,(y) 表示数据中的真实值。因此,模型的预测误差可以写成:

[ \hat{y}-y=f_{w,b}(x)-y ]

线性回归的目标是不断调整参数 (w) 和 (b),使预测值 (\hat{y}) 尽可能接近真实值 (y),从而减小代价函数 (J(w,b))。

线性回归的代价函数 (J(w,b))

在线性回归中,模型的预测函数为:

[ f_{w,b}(x^{(i)})=wx^{(i)}+b ]

其中,(w) 表示直线的斜率,(b) 表示截距,(x^{(i)}) 表示第 (i) 个样本的输入,(y^{(i)}) 表示该样本的真实值。

为了衡量模型预测值与真实值之间的差距,通常使用平方误差代价函数:

[ J(w,b)=\frac{1}{2m}\sum_{i=1}^{m}\left(f_{w,b}(x^{(i)})-y^{(i)}\right)^2 ]

把预测函数代入后,可以写成:

[ J(w,b)=\frac{1}{2m}\sum_{i=1}^{m}\left(wx^{(i)}+b-y^{(i)}\right)^2 ]

其中:

  • (m):训练样本的数量;
  • (f_{w,b}(x^{(i)})):模型对第 (i) 个样本的预测值;
  • (y^{(i)}):第 (i) 个样本的真实值;
  • (f_{w,b}(x^{(i)})-y^{(i)}):预测误差;
  • (J(w,b)):所有训练样本的平均误差,用来评价模型的拟合效果。

公式中的误差需要平方,这样可以避免正负误差相互抵消,同时会让较大的误差受到更明显的惩罚。分母中的 (2) 是为了在求导时抵消平方产生的系数,使后续计算更加简洁,不会影响代价函数最小值所在的位置。

线性回归训练的目标是寻找合适的 (w) 和 (b),使代价函数尽可能小:

[ \min_{w,b}J(w,b) ]

(J(w,b)) 越小,说明预测值越接近真实值,模型的拟合效果通常越好。梯度下降算法就是通过不断调整 (w) 和 (b),逐步找到使 (J(w,b)) 最小的参数。

Image Name