Commit 755ca109 by PolarisZZM

Update figure 2.1

parent 3413854a
...@@ -27,6 +27,8 @@ ...@@ -27,6 +27,8 @@
\usepackage{caption} \usepackage{caption}
\usepackage{subcaption} \usepackage{subcaption}
\graphicspath{{figures/}{images/}} \graphicspath{{figures/}{images/}}
\usepackage{tikz}
\usetikzlibrary{arrows.meta,calc}
% 颜色与强调框 % 颜色与强调框
\usepackage[most]{tcolorbox} \usepackage[most]{tcolorbox}
...@@ -173,22 +175,24 @@ ...@@ -173,22 +175,24 @@
值得注意的是,本部分并不以复杂数学推导和理论证明为主要目标,而是侧重于从概念、算法和应用设计三个层面帮助读者理解强化学习的基本思想与方法结构。最后,本部分还将简要介绍多智能体强化学习、样本重放、稳定性改进等前沿方向,以及大规模决策、训练不稳定、泛化能力不足和奖励构建困难等现实挑战,为后续理解生成式人工智能中的强化学习应用奠定基础。 值得注意的是,本部分并不以复杂数学推导和理论证明为主要目标,而是侧重于从概念、算法和应用设计三个层面帮助读者理解强化学习的基本思想与方法结构。最后,本部分还将简要介绍多智能体强化学习、样本重放、稳定性改进等前沿方向,以及大规模决策、训练不稳定、泛化能力不足和奖励构建困难等现实挑战,为后续理解生成式人工智能中的强化学习应用奠定基础。
\section{强化学习建模方法} \section{强化学习建模方法}
强化学习的核心在于对“智能体如何在环境中连续决策并根据反馈改进策略”这一问题进行形式化建模。与监督学习中给定输入样本并学习其对应标签不同,如图\ref{fig:example}所示,强化学习所面对的是一个动态交互过程:智能体需要在某一状态下选择动作,环境根据该动作发生状态转移并返回奖励信号,智能体再依据反馈调整后续行为。由此可见,强化学习并不只是解决某一次预测是否准确的问题,而是关注一系列决策行为在长期意义上能否带来更优结果。 强化学习的核心在于对“智能体如何在环境中连续决策并根据反馈改进策略”这一问题进行形式化建模。与监督学习中给定输入样本并学习其对应标签不同,如图\ref{fig:framework}所示,强化学习所面对的是一个动态交互过程:智能体需要在某一状态下选择动作,环境根据该动作发生状态转移并返回奖励信号,智能体再依据反馈调整后续行为。由此可见,强化学习并不只是解决某一次预测是否准确的问题,而是关注一系列决策行为在长期意义上能否带来更优结果。
\begin{figure}[htbp] \begin{figure}[htbp]
\centering \centering
\IfFileExists{figures/example.png}{ \IfFileExists{figures/framework.tex}{
\includegraphics[width=0.78\linewidth]{figures/example.png} \resizebox{0.78\linewidth}{!}{
\input{figures/framework.tex}
}
}{ }{
\fbox{ \fbox{
\begin{minipage}[c][5cm][c]{0.78\linewidth} \begin{minipage}[c][5cm][c]{0.78\linewidth}
\centering \centering
强化学习的基本建模框架 \texttt{figures/example.png} 强化学习的基本建模框架 \texttt{figures/f\_framework.tex}
\end{minipage} \end{minipage}
} }
} }
\caption{强化学习的基本建模框架} \caption{强化学习的基本建模框架}
\label{fig:example} \label{fig:framework}
\end{figure} \end{figure}
为了刻画这一交互过程,强化学习通常以马尔可夫决策过程作为基本数学框架。该框架将复杂的智能决策问题抽象为状态、动作、状态转移、奖励函数和策略等基本要素,并通过“当前状态决定未来演化”的马尔可夫性假设,建立起对序列决策问题的统一描述。在这一框架下,智能体的学习目标不再是简单地最大化某一步动作的即时收益,而是通过不断优化策略,使其在长期交互过程中获得尽可能高的累积奖励。 为了刻画这一交互过程,强化学习通常以马尔可夫决策过程作为基本数学框架。该框架将复杂的智能决策问题抽象为状态、动作、状态转移、奖励函数和策略等基本要素,并通过“当前状态决定未来演化”的马尔可夫性假设,建立起对序列决策问题的统一描述。在这一框架下,智能体的学习目标不再是简单地最大化某一步动作的即时收益,而是通过不断优化策略,使其在长期交互过程中获得尽可能高的累积奖励。
...@@ -198,34 +202,34 @@ ...@@ -198,34 +202,34 @@
马尔可夫决策过程(Markov Decision Process, MDP)是强化学习中描述序列决策问题的基本数学框架。强化学习所关注的并不是单次输入与输出之间的静态映射关系,而是智能体在连续交互过程中如何根据环境状态选择动作,并依据环境反馈不断改进策略。为了对这一过程进行形式化刻画,MDP 将智能体与环境之间的交互抽象为状态、动作、状态转移和奖励反馈所构成的动态过程,从而为后续算法设计提供统一的建模基础。 马尔可夫决策过程(Markov Decision Process, MDP)是强化学习中描述序列决策问题的基本数学框架。强化学习所关注的并不是单次输入与输出之间的静态映射关系,而是智能体在连续交互过程中如何根据环境状态选择动作,并依据环境反馈不断改进策略。为了对这一过程进行形式化刻画,MDP 将智能体与环境之间的交互抽象为状态、动作、状态转移和奖励反馈所构成的动态过程,从而为后续算法设计提供统一的建模基础。
MDP 的核心假设是马尔可夫性,即未来状态的变化只依赖于当前状态和当前动作,而与更早之前的历史状态和动作无关。其形式化表达为: MDP 的核心假设是马尔可夫性,即未来状态的变化只依赖于当前状态和当前动作,而与更早之前的历史状态和动作无关。其形式化表达为:
\[ \begin{equation}
P(s_{t+1} \mid s_t, a_t, s_{t-1}, a_{t-1}, \ldots, s_0, a_0) P(s_{t+1} \mid s_t, a_t, s_{t-1}, a_{t-1}, \ldots, s_0, a_0)
= =
P(s_{t+1} \mid s_t, a_t), P(s_{t+1} \mid s_t, a_t)
\] \end{equation}
其中,\(s_t\) 表示智能体在时刻 \(t\) 所处的状态,\(a_t\) 表示智能体在该状态下执行的动作,\(s_{t+1}\) 表示执行动作后环境转移到的下一状态。该假设意味着,只要当前状态 \(s_t\) 已经充分包含影响未来决策的信息,那么过去的交互历史就可以被当前状态所概括,智能体只需依据当前状态进行决策。 其中,\(s_t\) 表示智能体在时刻 \(t\) 所处的状态,\(a_t\) 表示智能体在该状态下执行的动作,\(s_{t+1}\) 表示执行动作后环境转移到的下一状态。该假设意味着,只要当前状态 \(s_t\) 已经充分包含影响未来决策的信息,那么过去的交互历史就可以被当前状态所概括,智能体只需依据当前状态进行决策。
通常,一个马尔可夫决策过程可以表示为五元组: 通常,一个马尔可夫决策过程可以表示为五元组:
\[ \begin{equation}
\mathcal{M} = (\mathcal{S}, \mathcal{A}, P, r, \gamma), \mathcal{M} = (\mathcal{S}, \mathcal{A}, P, r, \gamma)
\] \end{equation}
其中,\(\mathcal{S}\) 表示状态空间,\(\mathcal{A}\) 表示动作空间,\(P\) 表示状态转移概率,\(r\) 表示奖励函数,\(\gamma \in [0,1]\) 表示折扣因子。状态转移概率用于刻画智能体在状态 \(s_t\) 下执行动作 \(a_t\) 后转移到下一状态 \(s_{t+1}\) 的可能性: 其中,\(\mathcal{S}\) 表示状态空间,\(\mathcal{A}\) 表示动作空间,\(P\) 表示状态转移概率,\(r\) 表示奖励函数,\(\gamma \in [0,1]\) 表示折扣因子。状态转移概率用于刻画智能体在状态 \(s_t\) 下执行动作 \(a_t\) 后转移到下一状态 \(s_{t+1}\) 的可能性:
\[ \begin{equation}
P(s_{t+1} \mid s_t, a_t). P(s_{t+1} \mid s_t, a_t)
\] \end{equation}
奖励函数用于表示智能体在特定状态下执行动作并产生状态转移后所获得的反馈,通常可写为: 奖励函数用于表示智能体在特定状态下执行动作并产生状态转移后所获得的反馈,通常可写为:
\[ \begin{equation}
r_t = r(s_t, a_t, s_{t+1}). r_t = r(s_t, a_t, s_{t+1})
\] \end{equation}
在确定性环境中,如果下一状态 \(s_{t+1}\) 可以由当前状态 \(s_t\) 和动作 \(a_t\) 唯一确定,则奖励函数也可简化表示为: 在确定性环境中,如果下一状态 \(s_{t+1}\) 可以由当前状态 \(s_t\) 和动作 \(a_t\) 唯一确定,则奖励函数也可简化表示为:
\[ \begin{equation}
r_t = r(s_t, a_t). r_t = r(s_t, a_t)
\] \end{equation}
在 MDP 框架中,智能体与环境的交互会形成一条轨迹: 在 MDP 框架中,智能体与环境的交互会形成一条轨迹:
\[ \begin{equation}
\tau = (s_0, a_0, r_0, s_1, a_1, r_1, \ldots, s_T), \tau = (s_0, a_0, r_0, s_1, a_1, r_1, \ldots, s_T)
\] \end{equation}
其中,\(T\) 表示交互过程的终止时刻。强化学习算法通常通过采样或估计大量类似轨迹,分析不同策略所能获得的长期收益,并据此优化智能体的决策方式。 其中,\(T\) 表示交互过程的终止时刻。强化学习算法通常通过采样或估计大量类似轨迹,分析不同策略所能获得的长期收益,并据此优化智能体的决策方式。
\subsection{关键元素介绍} \subsection{关键元素介绍}
...@@ -243,15 +247,15 @@ r_t = r(s_t, a_t). ...@@ -243,15 +247,15 @@ r_t = r(s_t, a_t).
\item \textbf{奖励(Reward)。} 奖励是环境对智能体动作结果的反馈信号,通常记为 \(r_t\)。奖励可以用于表示动作带来的即时收益,也可以反映任务完成情况。奖励函数的设计是强化学习建模中的关键环节,因为它直接决定智能体学习的目标方向。例如,在五子棋中,胜利可以获得正奖励,失败可以获得负奖励;在路径规划中,到达目标可以获得奖励,而碰撞障碍物则会受到惩罚。 \item \textbf{奖励(Reward)。} 奖励是环境对智能体动作结果的反馈信号,通常记为 \(r_t\)。奖励可以用于表示动作带来的即时收益,也可以反映任务完成情况。奖励函数的设计是强化学习建模中的关键环节,因为它直接决定智能体学习的目标方向。例如,在五子棋中,胜利可以获得正奖励,失败可以获得负奖励;在路径规划中,到达目标可以获得奖励,而碰撞障碍物则会受到惩罚。
\item \textbf{策略(Policy)。} 策略表示智能体在给定状态下选择动作的规则,通常记为 \(\pi\)。在随机策略中,策略可表示为条件概率分布: \item \textbf{策略(Policy)。} 策略表示智能体在给定状态下选择动作的规则,通常记为 \(\pi\)。在随机策略中,策略可表示为条件概率分布:
\[ \begin{equation}
\pi(a_t \mid s_t), \pi(a_t \mid s_t)
\] \end{equation}
即智能体在状态 \(s_t\) 下选择动作 \(a_t\) 的概率。如果策略是确定性的,则每个状态对应一个固定动作;如果策略是随机性的,则策略给出不同动作被选择的概率。强化学习的核心目标就是不断优化策略,使智能体在长期交互过程中获得更高回报。 即智能体在状态 \(s_t\) 下选择动作 \(a_t\) 的概率。如果策略是确定性的,则每个状态对应一个固定动作;如果策略是随机性的,则策略给出不同动作被选择的概率。强化学习的核心目标就是不断优化策略,使智能体在长期交互过程中获得更高回报。
\item \textbf{轨迹(Trajectory)。} 轨迹是智能体与环境连续交互形成的状态、动作和奖励序列,通常表示为: \item \textbf{轨迹(Trajectory)。} 轨迹是智能体与环境连续交互形成的状态、动作和奖励序列,通常表示为:
\[ \begin{equation}
\tau = (s_0, a_0, r_0, s_1, a_1, r_1, \ldots, s_T). \tau = (s_0, a_0, r_0, s_1, a_1, r_1, \ldots, s_T)
\] \end{equation}
轨迹记录了智能体从初始状态到终止状态的完整决策过程。强化学习算法通常通过采样大量轨迹,估计不同策略的表现,并利用这些经验改进策略。 轨迹记录了智能体从初始状态到终止状态的完整决策过程。强化学习算法通常通过采样大量轨迹,估计不同策略的表现,并利用这些经验改进策略。
\end{itemize} \end{itemize}
...@@ -262,29 +266,29 @@ r_t = r(s_t, a_t). ...@@ -262,29 +266,29 @@ r_t = r(s_t, a_t).
强化学习的优化目标是学习一个最优策略,使智能体在与环境的持续交互过程中获得尽可能高的长期累积奖励。与只关注单一步骤预测结果的学习方法不同,强化学习并不以最大化某一时刻的即时奖励 \(r_t\) 为最终目标,而是关注一系列连续动作在整体上所带来的长期收益。因此,强化学习中的策略优化本质上是一种面向序列决策过程的长期收益最大化问题。 强化学习的优化目标是学习一个最优策略,使智能体在与环境的持续交互过程中获得尽可能高的长期累积奖励。与只关注单一步骤预测结果的学习方法不同,强化学习并不以最大化某一时刻的即时奖励 \(r_t\) 为最终目标,而是关注一系列连续动作在整体上所带来的长期收益。因此,强化学习中的策略优化本质上是一种面向序列决策过程的长期收益最大化问题。
设智能体与环境交互形成的状态--动作序列为: 设智能体与环境交互形成的状态--动作序列为:
\[ \begin{equation}
\tau = \{(s_1,a_1),(s_2,a_2),\ldots,(s_T,a_T)\}, \tau = \{(s_1,a_1),(s_2,a_2),\ldots,(s_T,a_T)\}
\] \end{equation}
其中,\(T\) 表示交互序列的总步数,\(\tau\) 表示在某一策略下生成的一条完整交互轨迹。在不考虑折扣因子的简化情况下,该轨迹上的长期累积奖励可表示为: 其中,\(T\) 表示交互序列的总步数,\(\tau\) 表示在某一策略下生成的一条完整交互轨迹。在不考虑折扣因子的简化情况下,该轨迹上的长期累积奖励可表示为:
\[ \begin{equation}
R(\tau)=\sum_{t=1}^{T} r_t , R(\tau)=\sum_{t=1}^{T} r_t
\] \end{equation}
其中,\(R(\tau)\) 表示轨迹 \(\tau\) 所对应的总累积奖励,\(r_t\) 表示智能体在时刻 \(t\) 获得的即时奖励。 其中,\(R(\tau)\) 表示轨迹 \(\tau\) 所对应的总累积奖励,\(r_t\) 表示智能体在时刻 \(t\) 获得的即时奖励。
在一般情况下,未来奖励的重要性通常会随着时间推移而降低,因此也可以引入折扣因子 \(\gamma \in [0,1]\),将长期累积奖励表示为折扣回报: 在一般情况下,未来奖励的重要性通常会随着时间推移而降低,因此也可以引入折扣因子 \(\gamma \in [0,1]\),将长期累积奖励表示为折扣回报:
\[ \begin{equation}
R(\tau)=\sum_{t=1}^{T} \gamma^{t-1} r_t . R(\tau)=\sum_{t=1}^{T} \gamma^{t-1} r_t
\] \end{equation}
其中,\(\gamma\) 用于调节未来奖励在当前决策中的重要程度。当 \(\gamma\) 趋近于 \(1\) 时,智能体更加重视长期收益;当 \(\gamma\) 较小时,智能体更加关注近期奖励。 其中,\(\gamma\) 用于调节未来奖励在当前决策中的重要程度。当 \(\gamma\) 趋近于 \(1\) 时,智能体更加重视长期收益;当 \(\gamma\) 较小时,智能体更加关注近期奖励。
由于状态--动作序列 \(\tau\) 的产生依赖于智能体所采用的策略,不同策略会诱导出不同的轨迹分布。设智能体的策略为 \(\pi_\theta(\cdot)\),其中 \(\theta\) 表示策略参数,则在策略 \(\pi_\theta\) 下,轨迹 \(\tau\) 出现的概率可记为 \(\Pr_\theta(\tau)\)。因此,需要考虑所有可能轨迹上的累积奖励期望,由此定义性能函数: 由于状态--动作序列 \(\tau\) 的产生依赖于智能体所采用的策略,不同策略会诱导出不同的轨迹分布。设智能体的策略为 \(\pi_\theta(\cdot)\),其中 \(\theta\) 表示策略参数,则在策略 \(\pi_\theta\) 下,轨迹 \(\tau\) 出现的概率可记为 \(\Pr_\theta(\tau)\)。因此,需要考虑所有可能轨迹上的累积奖励期望,由此定义性能函数:
\[ \begin{equation}
J(\theta) J(\theta)
= =
\mathbb{E}_{\tau \sim \Pr_\theta(\tau)}[R(\tau)] . \mathbb{E}_{\tau \sim \Pr_\theta(\tau)}[R(\tau)]
\] \end{equation}
进一步展开可得: 进一步展开可得:
\[ \begin{equation}
J(\theta) J(\theta)
= =
\sum_{\tau \in \mathcal{D}_{\tau}} \sum_{\tau \in \mathcal{D}_{\tau}}
...@@ -292,18 +296,18 @@ J(\theta) ...@@ -292,18 +296,18 @@ J(\theta)
= =
\sum_{\tau \in \mathcal{D}_{\tau}} \sum_{\tau \in \mathcal{D}_{\tau}}
\Pr_\theta(\tau) \Pr_\theta(\tau)
\sum_{t=1}^{T} \gamma^{t-1} r_t , \sum_{t=1}^{T} \gamma^{t-1} r_t
\] \end{equation}
其中,\(\mathcal{D}_{\tau}\) 表示所有可能轨迹构成的轨迹空间,\(\Pr_\theta(\tau)\) 表示在策略 \(\pi_\theta\) 下生成轨迹 \(\tau\) 的概率,\(J(\theta)\) 则用于衡量当前策略 \(\pi_\theta(\cdot)\) 在长期交互过程中的整体表现。 其中,\(\mathcal{D}_{\tau}\) 表示所有可能轨迹构成的轨迹空间,\(\Pr_\theta(\tau)\) 表示在策略 \(\pi_\theta\) 下生成轨迹 \(\tau\) 的概率,\(J(\theta)\) 则用于衡量当前策略 \(\pi_\theta(\cdot)\) 在长期交互过程中的整体表现。
由此,强化学习的训练目标可以表示为求解使性能函数最大化的最优策略参数: 由此,强化学习的训练目标可以表示为求解使性能函数最大化的最优策略参数:
\[ \begin{equation}
\theta^{*} = \arg\max_{\theta} J(\theta). \theta^{*} = \arg\max_{\theta} J(\theta)
\] \end{equation}
相应地,最优策略可表示为: 相应地,最优策略可表示为:
\[ \begin{equation}
\pi_{\theta^{*}} = \arg\max_{\pi_\theta} J(\theta). \pi_{\theta^{*}} = \arg\max_{\pi_\theta} J(\theta)
\] \end{equation}
这一优化目标说明,强化学习并不是简单追求某一步动作的即时收益最大化。某些动作虽然能够带来较高的短期奖励,却可能导致后续状态恶化,从而降低整个决策序列的长期收益;相反,某些动作在当前时刻的奖励可能较低,但有助于智能体在未来获得更高回报。因此,强化学习的关键在于使智能体学会在即时收益与未来收益之间进行权衡,并通过不断优化策略参数 \(\theta\),最大化性能函数 \(J(\theta)\),最终实现长期累积奖励的最大化。 这一优化目标说明,强化学习并不是简单追求某一步动作的即时收益最大化。某些动作虽然能够带来较高的短期奖励,却可能导致后续状态恶化,从而降低整个决策序列的长期收益;相反,某些动作在当前时刻的奖励可能较低,但有助于智能体在未来获得更高回报。因此,强化学习的关键在于使智能体学会在即时收益与未来收益之间进行权衡,并通过不断优化策略参数 \(\theta\),最大化性能函数 \(J(\theta)\),最终实现长期累积奖励的最大化。
......
Markdown 格式
0%
您添加了 0 到此讨论。请谨慎行事。
请先完成此评论的编辑!
注册 或者 后发表评论