Skip to content
项目
群组
代码片段
帮助
当前项目
正在载入...
登录 / 注册
切换导航面板
A
AML-Notes
概览
Overview
Details
Activity
Cycle Analytics
版本库
Repository
Files
Commits
Branches
Tags
Contributors
Graph
Compare
Charts
问题
0
Issues
0
列表
Board
标记
里程碑
合并请求
0
Merge Requests
0
CI / CD
CI / CD
流水线
作业
日程表
图表
维基
Wiki
代码片段
Snippets
成员
Collapse sidebar
Close sidebar
活动
图像
聊天
创建新问题
作业
提交
Issue Boards
Open sidebar
wangchenglong
AML-Notes
Commits
3413854a
Commit
3413854a
authored
Jul 03, 2026
by
PolarisZZM
Browse files
Options
Browse Files
Download
Email Patches
Plain Diff
Update section 2.1
parent
f136e8b3
显示空白字符变更
内嵌
并排
正在显示
2 个修改的文件
包含
170 行增加
和
4 行删除
+170
-4
aml_notes.pdf
+0
-0
aml_notes.tex
+170
-4
没有找到文件。
aml_notes.pdf
0 → 100644
查看文件 @
3413854a
File added
aml_notes.tex
查看文件 @
3413854a
...
...
@@ -163,7 +163,176 @@
\mainmatter
\pagestyle
{
fancy
}
\chapter
{
课程导论
}
\chapter
{
第一部分
}
\chapter
{
强化学习基础
}
强化学习作为机器学习的重要范式之一,主要研究智能体如何在与环境的持续交互中,根据反馈信号不断调整行为策略,从而实现长期收益最大化。与监督学习依赖静态标注样本不同,强化学习更关注动态决策过程中的策略改进问题,因此广泛应用于机器人控制、博弈决策、自动驾驶、推荐系统和交互式智能体等场景。
本章将围绕强化学习的基础理论与方法体系展开,重点介绍其建模框架、基本算法和应用设计方法。首先介绍马尔可夫决策过程、智能体、环境、状态、动作、奖励、策略与优化目标等核心概念;随后梳理基于价值函数的方法、基于策略优化的方法、Actor-Critic 框架,以及近端策略优化和离线强化学习等进阶算法;在此基础上,进一步讨论强化学习在具体任务中的建模步骤,包括状态空间、动作空间、奖励函数和训练过程设计。
值得注意的是,本部分并不以复杂数学推导和理论证明为主要目标,而是侧重于从概念、算法和应用设计三个层面帮助读者理解强化学习的基本思想与方法结构。最后,本部分还将简要介绍多智能体强化学习、样本重放、稳定性改进等前沿方向,以及大规模决策、训练不稳定、泛化能力不足和奖励构建困难等现实挑战,为后续理解生成式人工智能中的强化学习应用奠定基础。
\section
{
强化学习建模方法
}
强化学习的核心在于对“智能体如何在环境中连续决策并根据反馈改进策略”这一问题进行形式化建模。与监督学习中给定输入样本并学习其对应标签不同,如图
\ref
{
fig:example
}
所示,强化学习所面对的是一个动态交互过程:智能体需要在某一状态下选择动作,环境根据该动作发生状态转移并返回奖励信号,智能体再依据反馈调整后续行为。由此可见,强化学习并不只是解决某一次预测是否准确的问题,而是关注一系列决策行为在长期意义上能否带来更优结果。
\begin{figure}
[htbp]
\centering
\IfFileExists
{
figures/example.png
}{
\includegraphics
[width=0.78\linewidth]
{
figures/example.png
}
}{
\fbox
{
\begin{minipage}
[c][5cm][c]
{
0.78
\linewidth
}
\centering
强化学习的基本建模框架
\texttt
{
figures/example.png
}
\end{minipage}
}
}
\caption
{
强化学习的基本建模框架
}
\label
{
fig:example
}
\end{figure}
为了刻画这一交互过程,强化学习通常以马尔可夫决策过程作为基本数学框架。该框架将复杂的智能决策问题抽象为状态、动作、状态转移、奖励函数和策略等基本要素,并通过“当前状态决定未来演化”的马尔可夫性假设,建立起对序列决策问题的统一描述。在这一框架下,智能体的学习目标不再是简单地最大化某一步动作的即时收益,而是通过不断优化策略,使其在长期交互过程中获得尽可能高的累积奖励。
\subsection
{
马尔可夫决策过程
}
马尔可夫决策过程(Markov Decision Process, MDP)是强化学习中描述序列决策问题的基本数学框架。强化学习所关注的并不是单次输入与输出之间的静态映射关系,而是智能体在连续交互过程中如何根据环境状态选择动作,并依据环境反馈不断改进策略。为了对这一过程进行形式化刻画,MDP 将智能体与环境之间的交互抽象为状态、动作、状态转移和奖励反馈所构成的动态过程,从而为后续算法设计提供统一的建模基础。
MDP 的核心假设是马尔可夫性,即未来状态的变化只依赖于当前状态和当前动作,而与更早之前的历史状态和动作无关。其形式化表达为:
\[
P
(
s
_{
t
+
1
}
\mid
s
_
t, a
_
t, s
_{
t
-
1
}
, a
_{
t
-
1
}
,
\ldots
, s
_
0
, a
_
0
)
=
P
(
s
_{
t
+
1
}
\mid
s
_
t, a
_
t
)
,
\]
其中,
\(
s
_
t
\)
表示智能体在时刻
\(
t
\)
所处的状态,
\(
a
_
t
\)
表示智能体在该状态下执行的动作,
\(
s
_{
t
+
1
}\)
表示执行动作后环境转移到的下一状态。该假设意味着,只要当前状态
\(
s
_
t
\)
已经充分包含影响未来决策的信息,那么过去的交互历史就可以被当前状态所概括,智能体只需依据当前状态进行决策。
通常,一个马尔可夫决策过程可以表示为五元组:
\[
\mathcal
{
M
}
=
(
\mathcal
{
S
}
,
\mathcal
{
A
}
, P, r,
\gamma
)
,
\]
其中,
\(
\mathcal
{
S
}\)
表示状态空间,
\(
\mathcal
{
A
}\)
表示动作空间,
\(
P
\)
表示状态转移概率,
\(
r
\)
表示奖励函数,
\(
\gamma
\in
[
0
,
1
]
\)
表示折扣因子。状态转移概率用于刻画智能体在状态
\(
s
_
t
\)
下执行动作
\(
a
_
t
\)
后转移到下一状态
\(
s
_{
t
+
1
}\)
的可能性:
\[
P
(
s
_{
t
+
1
}
\mid
s
_
t, a
_
t
)
.
\]
奖励函数用于表示智能体在特定状态下执行动作并产生状态转移后所获得的反馈,通常可写为:
\[
r
_
t
=
r
(
s
_
t, a
_
t, s
_{
t
+
1
}
)
.
\]
在确定性环境中,如果下一状态
\(
s
_{
t
+
1
}\)
可以由当前状态
\(
s
_
t
\)
和动作
\(
a
_
t
\)
唯一确定,则奖励函数也可简化表示为:
\[
r
_
t
=
r
(
s
_
t, a
_
t
)
.
\]
在 MDP 框架中,智能体与环境的交互会形成一条轨迹:
\[
\tau
=
(
s
_
0
, a
_
0
, r
_
0
, s
_
1
, a
_
1
, r
_
1
,
\ldots
, s
_
T
)
,
\]
其中,
\(
T
\)
表示交互过程的终止时刻。强化学习算法通常通过采样或估计大量类似轨迹,分析不同策略所能获得的长期收益,并据此优化智能体的决策方式。
\subsection
{
关键元素介绍
}
在马尔可夫决策过程的形式化框架下,强化学习问题通常由智能体、环境、状态、动作、奖励、策略和轨迹等关键元素共同构成。这些元素分别对应决策过程中的不同环节:智能体负责作出决策,环境提供交互对象与反馈,状态刻画当前决策条件,动作表示智能体的行为选择,奖励反映动作结果的优劣,策略决定智能体如何依据状态选择动作,而轨迹则记录了智能体与环境连续交互的完整过程。理解这些元素之间的关系,是掌握强化学习建模方法的基础。
\begin{itemize}
\item
\textbf
{
智能体(Agent)。
}
智能体是强化学习中的决策主体,负责感知环境状态、选择动作,并在不断交互中调整自身策略。智能体可以是游戏中的棋手、机器人控制系统、自动驾驶车辆,也可以是推荐系统中的排序模型。其核心特征在于能够根据环境反馈不断改进行为,而不是仅执行预先设定的固定规则。
\item
\textbf
{
环境(Environment)。
}
环境是智能体进行交互的外部对象。智能体执行动作后,环境会发生相应变化,并向智能体返回新的状态和奖励信号。例如,在五子棋任务中,棋盘局面和对手可以共同构成环境;在机器人控制任务中,物理空间、障碍物和目标位置构成环境。环境决定了智能体动作产生的后果。
\item
\textbf
{
状态(State)。
}
状态表示智能体在某一时刻能够观察或感知到的环境信息,通常记为
\(
s
_
t
\)
。状态是智能体进行动作选择的依据。状态表示是否充分,直接影响强化学习模型的效果。如果状态信息不足,智能体可能无法判断当前处境;如果状态表示过于复杂,则会增加学习难度。以五子棋为例,当前棋盘上黑白棋子的分布就可以作为状态表示。
\item
\textbf
{
动作(Action)。
}
动作表示智能体在当前状态下可以执行的行为,通常记为
\(
a
_
t
\)
。动作空间可以是离散的,也可以是连续的。五子棋中的动作是“在某一空位落子”,属于离散动作;机器人控制中的动作可能是关节角度、速度或力矩变化,通常属于连续动作。动作空间的规模和结构会显著影响强化学习问题的难度。
\item
\textbf
{
奖励(Reward)。
}
奖励是环境对智能体动作结果的反馈信号,通常记为
\(
r
_
t
\)
。奖励可以用于表示动作带来的即时收益,也可以反映任务完成情况。奖励函数的设计是强化学习建模中的关键环节,因为它直接决定智能体学习的目标方向。例如,在五子棋中,胜利可以获得正奖励,失败可以获得负奖励;在路径规划中,到达目标可以获得奖励,而碰撞障碍物则会受到惩罚。
\item
\textbf
{
策略(Policy)。
}
策略表示智能体在给定状态下选择动作的规则,通常记为
\(
\pi
\)
。在随机策略中,策略可表示为条件概率分布:
\[
\pi
(
a
_
t
\mid
s
_
t
)
,
\]
即智能体在状态
\(
s
_
t
\)
下选择动作
\(
a
_
t
\)
的概率。如果策略是确定性的,则每个状态对应一个固定动作;如果策略是随机性的,则策略给出不同动作被选择的概率。强化学习的核心目标就是不断优化策略,使智能体在长期交互过程中获得更高回报。
\item
\textbf
{
轨迹(Trajectory)。
}
轨迹是智能体与环境连续交互形成的状态、动作和奖励序列,通常表示为:
\[
\tau
=
(
s
_
0
, a
_
0
, r
_
0
, s
_
1
, a
_
1
, r
_
1
,
\ldots
, s
_
T
)
.
\]
轨迹记录了智能体从初始状态到终止状态的完整决策过程。强化学习算法通常通过采样大量轨迹,估计不同策略的表现,并利用这些经验改进策略。
\end{itemize}
上述关键元素共同构成了强化学习问题的基本结构。智能体根据状态选择动作,环境根据动作产生状态转移并返回奖励,智能体再依据奖励反馈调整策略。强化学习的学习过程正是在这一循环中不断展开的。
\subsection
{
优化目标
}
强化学习的优化目标是学习一个最优策略,使智能体在与环境的持续交互过程中获得尽可能高的长期累积奖励。与只关注单一步骤预测结果的学习方法不同,强化学习并不以最大化某一时刻的即时奖励
\(
r
_
t
\)
为最终目标,而是关注一系列连续动作在整体上所带来的长期收益。因此,强化学习中的策略优化本质上是一种面向序列决策过程的长期收益最大化问题。
设智能体与环境交互形成的状态--动作序列为:
\[
\tau
=
\{
(
s
_
1
,a
_
1
)
,
(
s
_
2
,a
_
2
)
,
\ldots
,
(
s
_
T,a
_
T
)
\}
,
\]
其中,
\(
T
\)
表示交互序列的总步数,
\(
\tau
\)
表示在某一策略下生成的一条完整交互轨迹。在不考虑折扣因子的简化情况下,该轨迹上的长期累积奖励可表示为:
\[
R
(
\tau
)=
\sum
_{
t
=
1
}^{
T
}
r
_
t ,
\]
其中,
\(
R
(
\tau
)
\)
表示轨迹
\(
\tau
\)
所对应的总累积奖励,
\(
r
_
t
\)
表示智能体在时刻
\(
t
\)
获得的即时奖励。
在一般情况下,未来奖励的重要性通常会随着时间推移而降低,因此也可以引入折扣因子
\(
\gamma
\in
[
0
,
1
]
\)
,将长期累积奖励表示为折扣回报:
\[
R
(
\tau
)=
\sum
_{
t
=
1
}^{
T
}
\gamma
^{
t
-
1
}
r
_
t .
\]
其中,
\(
\gamma
\)
用于调节未来奖励在当前决策中的重要程度。当
\(
\gamma
\)
趋近于
\(
1
\)
时,智能体更加重视长期收益;当
\(
\gamma
\)
较小时,智能体更加关注近期奖励。
由于状态--动作序列
\(
\tau
\)
的产生依赖于智能体所采用的策略,不同策略会诱导出不同的轨迹分布。设智能体的策略为
\(
\pi
_
\theta
(
\cdot
)
\)
,其中
\(
\theta
\)
表示策略参数,则在策略
\(
\pi
_
\theta
\)
下,轨迹
\(
\tau
\)
出现的概率可记为
\(
\Pr
_
\theta
(
\tau
)
\)
。因此,需要考虑所有可能轨迹上的累积奖励期望,由此定义性能函数:
\[
J
(
\theta
)
=
\mathbb
{
E
}_{
\tau
\sim
\Pr
_
\theta
(
\tau
)
}
[
R
(
\tau
)]
.
\]
进一步展开可得:
\[
J
(
\theta
)
=
\sum
_{
\tau
\in
\mathcal
{
D
}_{
\tau
}}
\Pr
_
\theta
(
\tau
)
R
(
\tau
)
=
\sum
_{
\tau
\in
\mathcal
{
D
}_{
\tau
}}
\Pr
_
\theta
(
\tau
)
\sum
_{
t
=
1
}^{
T
}
\gamma
^{
t
-
1
}
r
_
t ,
\]
其中,
\(
\mathcal
{
D
}_{
\tau
}\)
表示所有可能轨迹构成的轨迹空间,
\(
\Pr
_
\theta
(
\tau
)
\)
表示在策略
\(
\pi
_
\theta
\)
下生成轨迹
\(
\tau
\)
的概率,
\(
J
(
\theta
)
\)
则用于衡量当前策略
\(
\pi
_
\theta
(
\cdot
)
\)
在长期交互过程中的整体表现。
由此,强化学习的训练目标可以表示为求解使性能函数最大化的最优策略参数:
\[
\theta
^{
*
}
=
\arg\max
_{
\theta
}
J
(
\theta
)
.
\]
相应地,最优策略可表示为:
\[
\pi
_{
\theta
^{
*
}}
=
\arg\max
_{
\pi
_
\theta
}
J
(
\theta
)
.
\]
这一优化目标说明,强化学习并不是简单追求某一步动作的即时收益最大化。某些动作虽然能够带来较高的短期奖励,却可能导致后续状态恶化,从而降低整个决策序列的长期收益;相反,某些动作在当前时刻的奖励可能较低,但有助于智能体在未来获得更高回报。因此,强化学习的关键在于使智能体学会在即时收益与未来收益之间进行权衡,并通过不断优化策略参数
\(
\theta
\)
,最大化性能函数
\(
J
(
\theta
)
\)
,最终实现长期累积奖励的最大化。
\section
{
强化学习的基本优化算法
}
\subsection
{
基于价值函数的方法
}
\subsection
{
基于策略优化的方法
}
\subsection
{
Actor-Critic 框架
}
\section
{
强化学习的进阶优化算法
}
\subsection
{
近端策略优化方法
}
\subsection
{
离线强化学习方法
}
\section
{
强化学习的应用设计方法
}
\subsection
{
强化学习的建模步骤
}
\subsection
{
状态空间与动作空间设计
}
\subsection
{
奖励函数设计
}
\subsection
{
强化学习训练过程设计
}
\section
{
强化学习的前沿方向
}
\subsection
{
多智能体强化学习
}
\subsection
{
面向样本重放的强化学习方法
}
\subsection
{
强化学习方法的稳定性改进
}
\section
{
强化学习方法的挑战
}
\subsection
{
面向大规模决策的挑战
}
\subsection
{
强化学习训练的不稳定性和泛化性问题
}
\subsection
{
强化学习方法的奖励构建问题
}
\section
{
本章小结
}
\begin{learninggoals}
\begin{itemize}
...
...
@@ -173,8 +342,6 @@
\end{itemize}
\end{learninggoals}
\section
{
课程说明
}
这里填写本讲的正文内容。中文可直接输入,不需要额外转码。若要突出关键词,可使用
\keyword
{
关键词强调
}
,也可以使用普通的
\textbf
{
加粗
}
、
\emph
{
斜体
}
等格式。
...
...
@@ -182,7 +349,6 @@
这里可以写课堂重点、易错点、考试提示,或者需要学生特别记住的概念。
\end{importantnote}
\section
{
表格示例
}
表格建议使用
\texttt
{
booktabs
}
提供的
\verb
|
\toprule
|
、
\verb
|
\midrule
|
、
\verb
|
\bottomrule
|
,
视觉会比普通竖线表格更清爽。
...
...
编写
预览
Markdown
格式
0%
重试
或
添加新文件
添加附件
取消
您添加了
0
人
到此讨论。请谨慎行事。
请先完成此评论的编辑!
取消
请
注册
或者
登录
后发表评论