Skip to content
Open
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
Original file line number Diff line number Diff line change
Expand Up @@ -9,7 +9,7 @@

在各种材料中经常看到的中英文词汇有:误差,偏差,Error,Cost,Loss,损失,代价......意思都差不多,在本书中,使用“损失函数”和“Loss Function”这两个词汇,具体的损失函数符号用 $J$ 来表示,误差值用 $loss$ 表示。

“损失”就是所有样本的“误差”的总和,亦即($m$ 为样本数):
“损失”就是所有样本的“误差”的总和,亦即( $m$ 为样本数):

$$损失 = \sum^m_{i=1}误差_i$$

Expand All @@ -31,9 +31,10 @@ $$J = \sum_{i=1}^m loss_i$$

### 3.0.2 机器学习常用损失函数

符号规则:$a$ 是预测值,$y$ 是样本标签值,$loss$ 是损失函数值。
符号规则: $a$ 是预测值, $y$ 是样本标签值, $loss$ 是损失函数值。

- Gold Standard Loss,又称0-1误差

$$
loss=\begin{cases}
0 & a=y \\\\
Expand All @@ -60,11 +61,13 @@ loss = -[y \cdot \ln (a) + (1-y) \cdot \ln (1-a)] \qquad y \in \\{ 0,1 \\}
$$

- Squared Loss,均方差损失函数

$$
loss=(a-y)^2
$$

- Exponential Loss,指数损失函数

$$
loss = e^{-(y \cdot a)}
$$
Expand All @@ -80,8 +83,8 @@ $$

图3-1中,纵坐标是损失函数值,横坐标是变量。不断地改变变量的值,会造成损失函数值的上升或下降。而梯度下降算法会让我们沿着损失函数值下降的方向前进。

1. 假设我们的初始位置在 $A$ 点,$x=x_0$,损失函数值(纵坐标)较大,回传给网络做训练;
2. 经过一次迭代后,我们移动到了 $B$ 点,$x=x_1$,损失函数值也相应减小,再次回传重新训练;
1. 假设我们的初始位置在 $A$ 点, $x=x_0$ ,损失函数值(纵坐标)较大,回传给网络做训练;
2. 经过一次迭代后,我们移动到了 $B$ 点, $x=x_1$ ,损失函数值也相应减小,再次回传重新训练;
3. 以此节奏不断向损失函数的最低点靠近,经历了 $x_2,x_3,x_4,x_5$;
4. 直到损失值达到可接受的程度,比如 $x_5$ 的位置,就停止训练。

Expand All @@ -91,7 +94,7 @@ $$

图3-2 双变量的损失函数图

图3-2中,横坐标是一个变量 $w$,纵坐标是另一个变量 $b$。两个变量的组合形成的损失函数值,在图中对应处于等高线上的唯一的一个坐标点。$w,b$ 所有不同值的组合会形成一个损失函数值的矩阵,我们把矩阵中具有相同(相近)损失函数值的点连接起来,可以形成一个不规则椭圆,其圆心位置,是损失值为 $0$ 的位置,也是我们要逼近的目标。
图3-2中,横坐标是一个变量 $w$,纵坐标是另一个变量 $b$。两个变量的组合形成的损失函数值,在图中对应处于等高线上的唯一的一个坐标点。 $w,b$ 所有不同值的组合会形成一个损失函数值的矩阵,我们把矩阵中具有相同(相近)损失函数值的点连接起来,可以形成一个不规则椭圆,其圆心位置,是损失值为 $0$ 的位置,也是我们要逼近的目标。

这个椭圆如同平面地图的等高线,来表示的一个洼地,中心位置比边缘位置要低,通过对损失函数值的计算,对损失函数的求导,会带领我们沿着等高线形成的梯子一步步下降,无限逼近中心点。

Expand Down