diff --git "a/\345\237\272\347\241\200\346\225\231\347\250\213/A2-\347\245\236\347\273\217\347\275\221\347\273\234\345\237\272\346\234\254\345\216\237\347\220\206/\347\254\2541\346\255\245 - \345\237\272\346\234\254\347\237\245\350\257\206/03.0-\346\215\237\345\244\261\345\207\275\346\225\260.md" "b/\345\237\272\347\241\200\346\225\231\347\250\213/A2-\347\245\236\347\273\217\347\275\221\347\273\234\345\237\272\346\234\254\345\216\237\347\220\206/\347\254\2541\346\255\245 - \345\237\272\346\234\254\347\237\245\350\257\206/03.0-\346\215\237\345\244\261\345\207\275\346\225\260.md" index cbfac5d80..b5b43676f 100644 --- "a/\345\237\272\347\241\200\346\225\231\347\250\213/A2-\347\245\236\347\273\217\347\275\221\347\273\234\345\237\272\346\234\254\345\216\237\347\220\206/\347\254\2541\346\255\245 - \345\237\272\346\234\254\347\237\245\350\257\206/03.0-\346\215\237\345\244\261\345\207\275\346\225\260.md" +++ "b/\345\237\272\347\241\200\346\225\231\347\250\213/A2-\347\245\236\347\273\217\347\275\221\347\273\234\345\237\272\346\234\254\345\216\237\347\220\206/\347\254\2541\346\255\245 - \345\237\272\346\234\254\347\237\245\350\257\206/03.0-\346\215\237\345\244\261\345\207\275\346\225\260.md" @@ -9,7 +9,7 @@ 在各种材料中经常看到的中英文词汇有:误差,偏差,Error,Cost,Loss,损失,代价......意思都差不多,在本书中,使用“损失函数”和“Loss Function”这两个词汇,具体的损失函数符号用 $J$ 来表示,误差值用 $loss$ 表示。 -“损失”就是所有样本的“误差”的总和,亦即($m$ 为样本数): +“损失”就是所有样本的“误差”的总和,亦即( $m$ 为样本数): $$损失 = \sum^m_{i=1}误差_i$$ @@ -31,9 +31,10 @@ $$J = \sum_{i=1}^m loss_i$$ ### 3.0.2 机器学习常用损失函数 -符号规则:$a$ 是预测值,$y$ 是样本标签值,$loss$ 是损失函数值。 +符号规则: $a$ 是预测值, $y$ 是样本标签值, $loss$ 是损失函数值。 - Gold Standard Loss,又称0-1误差 + $$ loss=\begin{cases} 0 & a=y \\\\ @@ -60,11 +61,13 @@ loss = -[y \cdot \ln (a) + (1-y) \cdot \ln (1-a)] \qquad y \in \\{ 0,1 \\} $$ - Squared Loss,均方差损失函数 + $$ loss=(a-y)^2 $$ - Exponential Loss,指数损失函数 + $$ loss = e^{-(y \cdot a)} $$ @@ -80,8 +83,8 @@ $$ 图3-1中,纵坐标是损失函数值,横坐标是变量。不断地改变变量的值,会造成损失函数值的上升或下降。而梯度下降算法会让我们沿着损失函数值下降的方向前进。 -1. 假设我们的初始位置在 $A$ 点,$x=x_0$,损失函数值(纵坐标)较大,回传给网络做训练; -2. 经过一次迭代后,我们移动到了 $B$ 点,$x=x_1$,损失函数值也相应减小,再次回传重新训练; +1. 假设我们的初始位置在 $A$ 点, $x=x_0$ ,损失函数值(纵坐标)较大,回传给网络做训练; +2. 经过一次迭代后,我们移动到了 $B$ 点, $x=x_1$ ,损失函数值也相应减小,再次回传重新训练; 3. 以此节奏不断向损失函数的最低点靠近,经历了 $x_2,x_3,x_4,x_5$; 4. 直到损失值达到可接受的程度,比如 $x_5$ 的位置,就停止训练。 @@ -91,7 +94,7 @@ $$ 图3-2 双变量的损失函数图 -图3-2中,横坐标是一个变量 $w$,纵坐标是另一个变量 $b$。两个变量的组合形成的损失函数值,在图中对应处于等高线上的唯一的一个坐标点。$w,b$ 所有不同值的组合会形成一个损失函数值的矩阵,我们把矩阵中具有相同(相近)损失函数值的点连接起来,可以形成一个不规则椭圆,其圆心位置,是损失值为 $0$ 的位置,也是我们要逼近的目标。 +图3-2中,横坐标是一个变量 $w$,纵坐标是另一个变量 $b$。两个变量的组合形成的损失函数值,在图中对应处于等高线上的唯一的一个坐标点。 $w,b$ 所有不同值的组合会形成一个损失函数值的矩阵,我们把矩阵中具有相同(相近)损失函数值的点连接起来,可以形成一个不规则椭圆,其圆心位置,是损失值为 $0$ 的位置,也是我们要逼近的目标。 这个椭圆如同平面地图的等高线,来表示的一个洼地,中心位置比边缘位置要低,通过对损失函数值的计算,对损失函数的求导,会带领我们沿着等高线形成的梯子一步步下降,无限逼近中心点。