Top AI Repos — open-source AI, indexed and scored
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
A lecture note for understanding deep learning
| Date | Stars |
|---|---|
| 2026-07-31 | 463 |
| 2026-08-04 | 463 |
| 2026-08-06 | 465 |
Today
+2 stars today
This week
— stars this week
This month
— stars this month
Momentum
0.0
growth rate 0.00%/day
# 深度学习现象导论
本仓库包含了关于深度学习的讲义和相关资源,从现象出发,帮助深入理解深度学习的核心概念。面向深度学习相关的人员,包括研究人员,技术使用者,学生等
## 课程视频
完整的课程视频可以在 [Bilibili](https://space.bilibili.com/95975441/channel/seriesdetail?sid=3749682) (许志钦)上观看,涵盖了深度学习的基础和进阶内容。
## 更新内容(2025年6月28日)
1 主要修改了一些文字和表达错误。
2 增加第十五章“神经网络求解微分方程”
## 更新内容(2024年11月13日)
### 1. 实验部分
- **新增内容**:添加了实验部分,包括详细的实验讲义和对应的 Jupyter 文件。这些资料提供了深度学习的实际应用案例和数据分析,以加强讲义内容的理解。
### 2. 初始化对推理的影响
- **理论驱动的应用**:新增了一节关于初始化对推理性能影响的讨论,将凝聚理论应用到大语言模型中,展示了如何将理论见解有效地融入实际应用,形成从理论到应用的完整故事线。
### 3. 模型章节修改
- **变分自编码器更新**:对变分自编码器部分进行了改进。
## 第一章 深度学习介绍
### **整体介绍**
本章讲解了神经网络的运作机制(反向传播、梯度下降)、优化算法的演进以及损失函数的几何景观。与此同时,本章揭示了深度学习与传统统计学习理论的矛 **泛化之谜**(即过参数化模型反而拥有更好的泛化能力),并提出了**隐式偏好**这一核心概念来解释该现象。最后,提出**现象驱动**研究范式。
---
### **内容提纲**
<details>
<summary><b>1. 深度学习的本质</b></summary>
* **数据拟合 (Data Fitting):**
* 深度学习的数学本质是寻找一个函数模型,使其能逼近数据背后的客观规律(目标函数)。
* 目标是从输入空间到输出空间的映射,需在未见过的测试数据上表现良好(泛化)。
* **神经网络架构:**
* **神经元机制:** 模拟生物神经元,通过线性加权($w^Tx + b$)和非线性激活函数(ReLU, Sigmoid, Tanh等)处理信息。
* **多层结构:** 单层感知机只能解决线性问题(如无法解决 XOR 问题),多层神经网络通过层层叠加非线性变换,具备了极强的表达能力(万有逼近定理)。
</details>
<details>
<summary><b>2. 模型的训练与优化机制</b></summary>
* **损失函数 (Loss Function):**
* 用于衡量模型预测值与真实标签的差异。
* **回归问题:** 常用均方误差 (MSE)、绝对误差 (MAE)。
* **分类问题:** 常用交叉熵 (Cross-Entropy),通常配合 Softmax 将输出转化为概率分布。
* **损失景观 (Loss Landscape):**
* 描述损失函数随参数变化的几何形态。
* 深度学习的景观通常是非凸的高维曲面,包含大量的局部极小值、鞍点。
* **优化方法 (Optimization):**
* **反向传播 (Back Propagation):** 利用链式法则高效计算梯度,获得参数更新方向。
* **梯度下降 (GD) 及其变体:**
* **SGD (随机梯度下降):** 每次只用少量样本,计算快且引入随机噪声有助于逃离局部最优。
* **动量法 (Momentum/Nesterov):** 引入“惯性”跨越平坦区域或鞍点。
* **自适应方法 (AdaGrad, Adam):** 为不同参数自动调整学习率,加速收敛。
</details>
<details>
<summary><b>3. 训练的关键细节与理论限制</b></summary>
* **参数初始化 (Initialization):**
* 初始值的选择决定了训练的起点和动力学路径。
* 常用方法(LeCun, Xavier, Kaiming 初始化)旨在保持信号在深层传播时的方差稳定,防止梯度消失或爆炸。
* **没有免费的午餐定理 (No Free Lunch Theorem):**
* 没有任何一种算法能在所有可能的问题分布上都表现最优。
* 深度学习的成功在于其架构(如CNN、Transformer)恰好适配了真实世界数据(图像、文本)的特定结构。
</details>
<details>
<summary><b>4. 核心理论:泛化之谜与隐式偏好</b></summary>
* **泛化之谜 (Generalization Puzzle):**
* **传统观念:** 统计学习理论认为模型越复杂(参数越多),越容易过拟合(U形误差曲线)。
* **深度学习现象:** 现代的神经网络模型是**过参数化**的(参数量远超样本量),但它们不仅能完美拟合训练数据(训练误差为0),还能保持极好的泛化能力。
* **隐式偏好 (Implicit Bias):**
* **问题:** 在没有显式正则化项的情况下,为什么神经网络倾向于选择“好”的解?
* **解释:** 神经网络的特定架构配合特定的优化算法(如 SGD),自身带有“隐式正则化”效果,倾向于优先学习低复杂度的模式。
* **研究范式:现象驱动**
* 鉴于数学理论滞后于工程实践,提倡现象驱动研究:先通过大量实验观察宏观规律(如 Scaling Law),再建立数学模型解释这些现象。
</details>
## 第二章 数据与神经网络结构
### **整体介绍**
本章首先介绍了**全连接网络**,然后介绍**残差网络(ResNet)**,解释了如何通过“跳跃连接”解决深层网络的训练难题。在此基础上,本章介绍了不同数据类型的架构演进:为了适配**图像数据**的空间局部性与不变性,发展出了**卷积神经网络(CNN)**;为了处理**语言数据**的长程依赖与并行计算需求,从**循环神经网络(RNN)**迭代至彻底改变AI范式的**Transformer**架构。
---
### **内容提纲**
<details>
<summary><b>1. 全连接神经网络架构及残差网络架构</b></summary>
* **全连接网络 (FCN):**
* **定义:** 最基础的结构,层与层之间所有神经元两两连接。
* **局限:** 虽然理论上具备万有逼近能力,但忽略了数据的空间/时间结构,处理高维数据(如图像)时参数量爆炸,且泛化能力较弱。
* **残差网络 (ResNet):**
* **解决的核心问题:** “退化现象”(Degradation),即随着网络层数增加,训练误差反而上升,而非过拟合。
* **核心机制:** 引入**跳跃连接 (Skip Connection)**。
* **意义:** 有效缓解了深层网络中的梯度消失问题,使得训练成百上千层的网络成为可能。
</details>
<details>
<summary><b>2. 视觉任务:从生物启发到卷积网络 (CNN)</b></summary>
* **图像数据特性:**
* **局部相关性:** 邻近像素通常强相关。
* **不变性:** 平移、旋转、缩放不变性及统计不变性。
* **生物学启发:**
* 源自对生物视皮层(V1区)的研究,发现简单细胞(提取边缘方向)和复杂细胞(具有位置不变性)。
* **CNN 核心组件:**
* **卷积层 (Convolution):** 利用**局部连接**和**权重共享**机制,大幅减少参数量,有效提取局部特征(如边缘、纹理)。
* **池化层 (Pooling):** 进行下采样(最大池化/平均池化),引入平移不变性,扩大感受野。
</details>
<details>
<summary><b>3. 语言任务:从循环网络 (RNN) 到 Transformer</b></summary>
* **语言数据特性:** 序列性、变长、强上下文依赖、离散符号。
* **循环神经网络 (RNN) 与 LSTM:**
* **RNN:** 通过隐藏状态传递记忆,但存在严重的梯度消失/爆炸问题,且无法并行计算。
* **LSTM/GRU:** 引入门控机制(遗忘门、输入门等)和记忆单元 (Cell State),解决了长序列训练中的梯度问题,能捕捉长距离依赖。
* **Transformer(核心重点):**
* **革命性突破:** 抛弃循环结构,完全基于**注意力机制 (Attention)**,实现了**并行计算**。
* **关键技术:**
* **位置编码 (Positional Encoding)Excerpt of 25,341 characters
Read on GitHubWould you bet a product on this? Bounded 0–100 and slow moving.
matched fp:fc8fd67b80cc54da, llm:Repository description: 'A lecture note for understanding deep learning' (Jupyter Notebook)
matched fp:fc8fd67b80cc54da, llm:Repository description: 'A lecture note for understanding deep learning' (Jupyter Notebook)