Commit 02467ac0 by luoyingfeng

update

parent f136e8b3
......@@ -277,6 +277,181 @@
课后 & 作业、复盘、扩展阅读 & 可列出提交要求 \\
\bottomrule
\end{longtable}
\chapter{⼤模型预训练与微调⽅法}
\section{⼤模型预训练}
\chapter{深度学习中的连续动⼒学机制}
\section{数学基础}
常微分方程(ODE)这一概念源自更广义的微分方程概念。该学科研究变量的变化规律,有着悠久且丰硕的发展历程 [爱德华兹,1994;邓纳姆,2005]。
如今,微分方程已成为现代科学与工程领域的核心工具语言,应用场景十分广泛。
本节将介绍微分方程的基础概念,重点围绕常微分方程展开讲解,并举例说明这类数学工具在深度学习中的若干应用。
\subsection{常微分方程的基本概念}
我们首先考虑一个简单的汽车运动问题,并在本节中始终以此为例来引出若干关键概念。假设我们观察到一辆汽车沿直线行驶。令 \(t \in \mathbb{R}\) 表示时间,并将其作为自变量。记汽车在任意时刻 \(t\) 的位置为 \(x(t)\)。其中,\(x(t)\) 是因变量,其取值依赖于自变量 \(t\)。在某些情况下,为了简化记号,我们会省略函数的自变量,即用 \(x\) 代替 \(x(t)\)
我们知道,汽车的速度是其位置关于时间的变化率。在微积分中,这一变化率记为导数 \(\frac{\mathrm{d}x(t)}{\mathrm{d}t}\)。其中,\(\mathrm{d}x(t)\)\(\mathrm{d}t\) 称为微分,分别表示因变量和自变量的无穷小变化。导数 \(\frac{\mathrm{d}x(t)}{\mathrm{d}t}\) 描述了位置 \(x(t)\) 关于时间 \(t\) 的瞬时变化率。因此,这一概念定义在某一时刻,而不是某个有限的时间区间上。从数学上看,\(\frac{\mathrm{d}x(t)}{\mathrm{d}t}\) 可以写成差商的极限
\begin{equation}
\frac{\mathrm{d}x(t)}{\mathrm{d}t}
=
\lim_{\Delta t \to 0}
\frac{x(t+\Delta t)-x(t)}{\Delta t}.
\end{equation}
如果汽车的速度由某种依赖于其当前位置和时间的规律所决定,例如道路摩擦力或风阻随位置和时间发生变化,那么我们可以使用函数 \(f(\cdot)\) 来表示这一关系
\begin{equation}
\frac{\mathrm{d}x(t)}{\mathrm{d}t}
=
f\bigl(x(t),t\bigr).
\end{equation}
这个方程被正式称为常微分方程(ordinary differential equation,ODE)。“常”意味着因变量 \(x(t)\) 是单个自变量 \(t\) 的函数。与之相对的是偏微分方程(partial differential equation,PDE),其中未知函数依赖于多个自变量。
\subsection{常微分方程的求解:积分表示与数值方法}
我们已经说明,常微分方程(ODE)刻画的是状态 $x(t)$ 的导数。一个自然的问题是:为什么我们要用导数来定义系统,而不是直接描述状态 $x(t)$ 本身?
事实上,如果整个轨迹 $x(t)$ 都已知,那么ODE的描述是多余的。然而,在许多实际应用中,我们无法得到 $x(t)$ 的解析表达式。我们通常只给定系统的动力学函数 $f(\cdot)$ 以及初始条件 $x(0)$
这类似于驾驶汽车:我们可以很容易知道当前时刻的速度,但要精确确定相对于起点的位置却更困难。在ODE语言中,速度对应 $f(\cdot)$,起点对应 $x(0)$,而我们的目标是重建整个轨迹 $x(t)$ 的“路径”。
在这种情况下,我们需要求解常微分方程,这通常被称为初值问题(IVP)。即给定ODE以及初始状态 $x(0)$,希望从导数信息中恢复任意时刻 $t$ 的状态 $x(t)$
根据微积分基本定理,时刻 $t$ 的状态可以表示为初始状态与在区间 $[0,t]$ 上所有瞬时变化的累积:
\[
x(t) = x(0) + \int_0^t \frac{dx(\tau)}{d\tau} d\tau
\]
由于 $\frac{dx(\tau)}{d\tau} = f(x(\tau), \tau)$,因此可以写为:
\[
x(t) = x(0) + \int_0^t f(x(\tau), \tau)\, d\tau \tag{8}
\]
如图2所示,该公式具有非常直观的几何解释:积分项
\[
\int_0^t f(x(\tau), \tau)\, d\tau
\]
表示函数 $f(x(\tau), \tau)$ 在区间 $[0,t]$ 上曲线下的带符号面积。
该面积刻画了状态在时间区间 $[0,t]$ 内的累计变化量。因此,该等式说明:某一时刻的状态等于初始状态加上累计变化。
\subsection*{计算挑战与数值求解}
然而,这种积分形式在计算上存在困难。尽管表达式看起来简单,但由于被积函数 $f(x(\tau), \tau)$ 依赖于未知的轨迹 $x(\tau)$ 本身,因此无法直接计算。
此外,即使轨迹是显式的,由于动力系统通常具有非线性(例如由深度神经网络建模),解析积分也往往不可行。
因此,我们必须使用数值方法来近似该积分,这一过程被称为“离散化(discretization)”。
其核心思想是:不再连续地追踪系统在每一个无穷小时间点的变化,而是在一系列离散时间点上近似轨迹:
\[
\{t_0, t_1, \ldots, t_N\}
\]
由于在有限个点上评估函数 $f(\cdot)$ 计算成本较低,因此这种方法在实践中非常高效。
\subsection*{Riemann积分视角}
从黎曼积分的角度来看,可以通过将积分区间划分为多个小区间,并用矩形面积之和来近似连续积分。
具体而言,在区间 $[0,t]$ 上构造时间网格:
\[
0 = t_0 < t_1 < \cdots < t_N = t
\]
在每个小区间上,用函数值乘以时间步长来近似积分贡献,从而得到整体近似。
\subsection{深度学习模型的常微分方程解释}
\section{神经常微分方程与流模型}
\subsection{神经常微分方程}
\subsection{伴随灵敏度法}
\subsection{基于流的生成模型}
\subsubsection{向量场、轨迹与流映射}
\subsubsection{连续归一化流}
\subsection{流匹配}
\section{视觉中的扩散模型}
\subsection{问题设定}
\subsubsection{生成建模作为概率输运}
\subsubsection{前向过程与反向过程的对偶性}
\subsubsection{训练与推理}
\subsection{随机视角:随机微分方程}
\subsubsection{前向与反向随机微分方程}
\subsubsection{分数函数的学习}
\subsubsection{方差爆炸与方差保持随机微分方程}
\subsubsection{数值求解器}
\subsection{确定性视角:概率流常微分方程}
\subsubsection{从随机微分方程到常微分方程}
\subsubsection{流匹配}
\subsection{迈向更高效的生成}
\subsubsection{高阶与专用求解器}
\subsubsection{轨迹校直}
\subsubsection{一致性模型}
\section{语言中的扩散模型}
\subsection{词元序列生成}
\subsubsection{自回归生成与非自回归生成}
\subsubsection{作为非自回归生成的扩散建模}
\subsection{连续空间中的扩散:嵌入空间扩散}
\subsubsection{基本框架}
\subsubsection{长度预测}
\subsubsection{取整}
\subsection{词元空间中的扩散:离散扩散}
\subsubsection{连续时间马尔可夫链视角}
\subsubsection{掩码扩散模型}
\subsection{关于离散扩散的进一步讨论}
\subsubsection{重新审视非吸收式替换扩散}
\subsubsection{掩码扩散建模与掩码语言建模}
\subsubsection{作为连续松弛的单纯形与 Logit 动力学}
\subsubsection{与迭代细化的关系}
\subsubsection{扩散 Transformer}
\subsubsection{基于流的视角}
\appendix
\chapter{附录}
......
Markdown 格式
0%
您添加了 0 到此讨论。请谨慎行事。
请先完成此评论的编辑!
注册 或者 后发表评论