L3 · 由简入深系列 · 原理地基

10 天,搞懂神经网络到底是怎么「学」的

全程中文 · 从一条直线讲到注意力机制 · 三个可动手玩的可视化实验台

📌 这是 L3(地基层)。学完你会真正理解梯度下降、反向传播、CNN 与注意力,再看 L2 大模型原理 会豁然开朗。数学只用到乘法、加法和"斜率"的概念,不需要任何数学背景。
💡 怎么用:每天点开一张卡片,先读教程再玩下面的演示;学完勾选「我已掌握」,进度条会自动增长(保存在你本机浏览器)。强烈建议每章都配合演示台动手拖一拖——梯度下降、激活函数、神经网络训练,看动画一次胜过读十遍公式。

📊 我的学习进度

已完成 0 / 10 天

🗓️ 每日学习计划(10 天)

🎮 三个互动实验台

全部在你的浏览器里实时计算,不联网、不装环境。第三个是**真的在训练一个神经网络**。

1. 梯度下降「下山台」(配合第 3 章)

小球从起点出发,每一步都朝坡度的反方向走。调学习率,看它是稳稳落底、还是疯狂横跳。
0.10 -4.8
步数 0 当前 w -4.80 损失 L 0.00 梯度 dL/dw 0.00 待出发
试试这三件事:
① 学习率拉到 0.02 → 走得极慢,几十步还没到底(学得太慢)
② 学习率拉到 1.20 以上 → 小球在谷底两侧横跳甚至飞出去(梯度爆炸,损失变 NaN 就是这么来的)
③ 选「双谷」,起点分别放在最左和最右 → 会落进不同的坑,这就是局部最优

2. 神经元与激活函数「实验台」(配合第 4 章)

一个神经元做两件事:先算 z = w·x + b,再把 z 丢进激活函数。拖动 w、b 看曲线怎么变,虚线是它的导数——导数趋近 0 的地方,就是梯度消失发生的地方。
1.0 0.0
输出 a = f(w·x+b) 导数 f'(z)(虚线) 线性部分 z = w·x+b

3. 迷你神经网络「训练台」(配合第 4、5、6、7 章)

这是一个真正在跑的神经网络:前向传播 → 交叉熵损失 → 反向传播 → 梯度下降,全部在你浏览器里逐轮执行。背景色是它当前的决策边界,看它一点点学会分开两类点。
0.30
类别 A 类别 B 背景深浅 = 模型认为该区域属于哪一类的把握 · 在图上点一下可加点(Shift+点击加蓝点)
损失曲线(越低越好)
训练轮次 epoch 0 损失 loss 准确率 参数量
必做的四个实验(结论都实测过):
① 选 异或 XOR + 隐藏层 0 层 → 只有 3 个参数,训练再久准确率也在 50% 上下徘徊,因为一条直线永远分不开异或(第 4 章)
② 同样是 XOR,隐藏层改成 1 层(33 个参数)→ 十几秒就 100% 分开,这就是非线性激活的威力
③ 选 双螺旋 + 1 层 8 神经元 → 卡在 94% 左右,边界很粗糙;加到 3 层 16 神经元(609 个参数)→ 能缠出完整螺旋并到 100%,这就是深度的价值(第 5 章)
④ 把学习率拉到 5 或 15 → 损失曲线会飙起来、准确率掉回 50%,右侧会显示「💥 发散中」。这和演示 1 里小球飞出画面是同一件事(第 3 章)
※ 还可以直接在图上点击添加数据点,看模型如何重新调整边界。

📚 教程目录(站内中文,点开即看)

由简入深 · 全系列

L1 AI入门·提示词L2 大模型原理L3 深度学习基础 · 你在这里 → L4 RAG/Agent → L5 微调部署 → L6 RLHF对齐 → L7 AIGC扩散 → L8 多模态/MCP

📖 学完本站建议顺序:想做应用走 L4 → L5;想搞算法走 L2 → L5 → L6。