L3 · 由简入深系列 · 原理地基
10 天,搞懂神经网络到底是怎么「学」的
全程中文 · 从一条直线讲到注意力机制 · 三个可动手玩的可视化实验台
📌 这是 L3(地基层)。学完你会真正理解梯度下降、反向传播、CNN 与注意力,再看 L2 大模型原理 会豁然开朗。数学只用到乘法、加法和"斜率"的概念,不需要任何数学背景。
🎮 三个互动实验台
全部在你的浏览器里实时计算,不联网、不装环境。第三个是**真的在训练一个神经网络**。
3. 迷你神经网络「训练台」(配合第 4、5、6、7 章)
这是一个真正在跑的神经网络:前向传播 → 交叉熵损失 → 反向传播 → 梯度下降,全部在你浏览器里逐轮执行。背景色是它当前的决策边界,看它一点点学会分开两类点。
0.30
类别 A
类别 B
背景深浅 = 模型认为该区域属于哪一类的把握 · 在图上点一下可加点(Shift+点击加蓝点)
损失曲线(越低越好)
训练轮次 epoch 0
损失 loss —
准确率 —
参数量 —
必做的四个实验(结论都实测过):
① 选 异或 XOR + 隐藏层 0 层 → 只有 3 个参数,训练再久准确率也在 50% 上下徘徊,因为一条直线永远分不开异或(第 4 章)
② 同样是 XOR,隐藏层改成 1 层(33 个参数)→ 十几秒就 100% 分开,这就是非线性激活的威力
③ 选 双螺旋 + 1 层 8 神经元 → 卡在 94% 左右,边界很粗糙;加到 3 层 16 神经元(609 个参数)→ 能缠出完整螺旋并到 100%,这就是深度的价值(第 5 章)
④ 把学习率拉到 5 或 15 → 损失曲线会飙起来、准确率掉回 50%,右侧会显示「💥 发散中」。这和演示 1 里小球飞出画面是同一件事(第 3 章)
※ 还可以直接在图上点击添加数据点,看模型如何重新调整边界。