2 输入 → 2 隐藏 → 1 输出 | η = 1

同一只猫,走三个来回

每一轮都是「正向算代价 → 反向算梯度 → 更新参数」。点击图上任意数值,可以看到它是怎么算出来的。

z = w·a前 + b
加权和:本层参数 × 前一层输出,再加偏置
σ(z) = 1/(1+e⁻ᶻ)
激活函数:把任意数压到 0~1,输出记作 a
C = (a2 − y)²
代价函数:输出与目标的差,取平方
σ′(z) = a(1−a)
激活函数的斜率(这是 σ′ 的算法,不是额外乘数)
δ = ∂C/∂z
代价对本层加权和的敏感度
w ← w − η·∂C/∂w
更新规则:沿负梯度走一步
正向

两层网络三轮训练过程 w1_11 w1_12 w1_21 w1_22 w2_1 w2_2 x1 耳朵 0.9 x2 眼睛 0.8 隐1 隐2 输出 C 目标 y = 1.0 ↑ 点任意数值看它怎么算出来的

← → 方向键可翻步。绿=正向,橙=反向,紫=更新参数。三轮结束后代价从 0.1498 降到 0.0495。