Commit 6409ff87 by 赵润松

第五讲:多模态机器学习与生成式人工智能(框架+图像部分)

按组长大纲与第五部分PDF搭建第五讲整体结构,拆分为 chapters/ch5_multimodal.tex 由主文件引入:
- 5.1 表示学习与跨模态对齐:单模态编码、自监督预训练、跨模态对齐(含CLIP InfoNCE损失)、跨模态融合
- 5.2 基础模型结构与训练:通用结构、视觉语言模型、指令微调、图像-语音-文本联合建模
- 5.3 条件生成建模:条件生成基础、文生图(扩散+CFG公式)、图像编辑、跨模态交互生成
- 全程以机器学习问题为主线,图像内容写实,语音/音频小节用 \todochen 占位待陈丹补充
XeLaTeX 编译通过。
parent f136e8b3
......@@ -121,6 +121,11 @@
\newcommand{\blankline}{\par\noindent\rule{\linewidth}{0.4pt}\par}
\newcommand{\keyword}[1]{\textbf{\color{CourseBlue}#1}}
% 协作占位:标记"待陈丹补充(语音/音频部分)"的内容,便于后续合并时定位
\newcommand{\todochen}[1]{%
\par\noindent
{\color{CourseGold}\small$\blacktriangleright$\ \textbf{[待陈丹补充 ·\ 语音/音频]}\ #1}\par}
\begin{document}
% 封面
......@@ -278,6 +283,14 @@
\bottomrule
\end{longtable}
% ============================================================
% 第五部分 多模态机器学习与生成式人工智能(润松负责:框架 + 图像内容)
% 内容本身定位为课程"第五部分",因此把章节计数器对齐到"第五讲"。
% 语音/音频小节由陈丹补充(见文中 \todochen 占位标记)。
% ============================================================
\setcounter{chapter}{4}
\include{chapters/ch5_multimodal}
\appendix
\chapter{附录}
......
% !TeX root = ../aml_notes.tex
% ============================================================
% 第五部分 多模态机器学习与生成式人工智能
% 负责人:润松(整体框架 + 图像相关内容 + 章节衔接)
% 协作:语音/音频小节由陈丹补充,统一用 \todochen{...} 标记占位。
% 讲述主线:表示学习与跨模态对齐 → 多模态基础模型结构与训练 → 条件生成建模与内容生成
% ============================================================
\chapter{多模态机器学习与生成式人工智能}
\label{ch:multimodal}
\begin{learninggoals}
\begin{itemize}
\item 从机器学习机制出发理解多模态生成式人工智能,而不是停留在罗列若干应用任务。
\item 掌握图像、语音/音频与文本如何被编码为可学习、可比较、可融合的表示,并在统一语义空间中实现跨模态对齐。
\item 理解视觉编码器、语音编码器如何接入大语言模型,以及多模态指令微调如何形成理解与交互能力。
\item 把文本生成图像、图像编辑、语音合成、文本生成音频与跨模态交互生成,统一理解为\keyword{条件分布学习与生成控制}问题。
\item 能够从表示学习、对齐学习、模型结构、训练方法、条件生成五个角度,分析典型多模态生成式人工智能系统。
\end{itemize}
\end{learninggoals}
\section*{本讲总体定位}
\addcontentsline{toc}{section}{本讲总体定位}
本讲围绕生成式人工智能中的\keyword{多模态机器学习}方法展开,重点讨论图像、语音/音频与文本等不同模态如何被表示、对齐、融合、建模与生成。与单一文本建模相比,多模态生成式人工智能需要处理更加复杂的数据结构:图像具有空间结构,语音/音频具有连续时间结构,文本具有离散符号结构。不同模态在数据形态、语义粒度、噪声特征和生成目标上存在差异,因此需要从高级机器学习角度系统讨论\keyword{表示学习、对齐学习、基础模型训练和条件生成建模}等问题。
本讲的讲述主线是:
\begin{center}
\fbox{\begin{minipage}{0.9\linewidth}\centering
多模态表示学习与跨模态对齐\ $\rightarrow$\ 多模态基础模型结构与训练方法\ $\rightarrow$\ 条件生成建模与多模态内容生成
\end{minipage}}
\end{center}
\noindent 其中,\ref{sec:repr} 主要回答“不同模态如何被机器学习模型表示,并进入统一语义空间”;\ref{sec:foundation} 主要回答“图像、语音等非文本模态如何接入大语言模型,并形成多模态理解、推理和交互能力”;\ref{sec:generation} 主要回答“模型如何在给定文本、图像、语音等条件下生成新的图像、语音和音频内容”。
\begin{importantnote}
本讲反复强调的一个组织原则是:\textbf{不要从“图像任务、语音任务、音频任务”直接展开,而要先建立机器学习问题,再把图像和语音作为典型模态讲进去。}这更贴合“高级机器学习:生成式人工智能视角”的课程定位。每一节都会围绕四个问题展开:解决什么机器学习问题;图像和语音分别怎么体现;和生成式人工智能有什么关系;可以选哪些代表模型或论文案例。
\end{importantnote}
% ============================================================
\section{多模态表示学习与跨模态对齐}
\label{sec:repr}
% ============================================================
\subsection*{本节内容定位}
本节是第五部分的基础环节,讲解多模态生成式人工智能中的\keyword{表示学习与对齐学习}问题。从机器学习角度看,图像、语音/音频和文本是不同类型的数据分布:图像是二维空间信号,语音/音频是连续时间信号,文本是离散符号序列。多模态模型要同时处理这些模态,首先需要将它们转化为可学习、可比较、可融合的向量表示。
因此本节重点讲清两个基础问题:第一,不同模态如何从原始数据转化为高层语义表示;第二,不同模态之间如何通过学习目标建立语义对应关系。这部分内容为后续多模态大模型和多模态生成模型提供基础——图像、语音和文本只有先形成有效表示,并在语义空间中实现对齐,才能进一步接入大语言模型,支撑视觉问答、语音交互、图像生成、语音合成和跨模态编辑等任务。
% ----------------------------------------------------------
\subsection{单模态表示学习:图像、语音与文本的编码}
\label{sub:encode}
\paragraph{解决的机器学习问题。}本小节的内部逻辑是从“原始数据”到“模型表示”。图像、语音和文本的原始形式差异很大,无法直接进入统一模型进行高层语义推理。因此课程首先讲清各模态如何通过编码器被转换为向量表示。这对应机器学习中的\keyword{表示学习}问题,也是多模态模型能够工作的第一步。
\paragraph{图像怎么体现。}图像的原始形式是由像素组成的二维矩阵,但像素本身难以直接表达物体、场景、空间关系和高级语义。因此视觉模型需要通过编码器提取图像特征:
\begin{itemize}
\item \keyword{卷积神经网络(CNN)}利用\textbf{局部感受野}\textbf{层次结构},从低级的纹理、边缘逐步抽象到目标和场景结构(代表:LeNet、AlexNet、ResNet)。
\item \keyword{Vision Transformer(ViT)}先把图像划分为若干 \texttt{patch},将每个 patch 线性映射为一个\keyword{视觉 token},再用自注意力建模 token 之间的全局关系,从而把图像表征为一组视觉 token(代表:ViT、Swin Transformer)。
\end{itemize}
通过这一过程,图像表征从低级视觉特征逐步上升到高级语义特征,并最终以“一串视觉 token”的形式,与文本 token 在结构上对齐,为后续接入大语言模型铺平道路。
\paragraph{语音/音频怎么体现。}
\todochen{从波形、频谱图与梅尔频谱讲起,说明语音是一种连续时间信号,其中同时包含语言内容、说话人信息、音色、韵律、情感和背景环境;进一步讲解语音编码器、自监督语音表征和音频 token 化,使学生理解语音/音频如何从连续声学信号转化为可供模型建模的表示。可对照图像“patch→视觉 token”说明语音“帧→声学/语义 token”的相似与差异。}
\paragraph{文本怎么体现。}文本方面只需简要介绍 token embedding、上下文表示和语言模型中的语义空间。文本部分不展开为独立重点,但需要为后续图文对齐、语音文本对齐和多模态大模型接入提供统一的符号基础:文本天然是离散 token 序列,图像和语音的“token 化”正是在向这种结构靠拢。
\begin{importantnote}
统一视角:三种模态最终都被组织为\textbf{一串向量化的 token}。差异在于——图像 token 来自空间网格,语音/音频 token 来自时间帧,文本 token 来自词表。把“原始信号 $\rightarrow$ token 序列”这一步看成共同语言,是理解后续所有多模态模型的关键。
\end{importantnote}
% ----------------------------------------------------------
\subsection{自监督学习与预训练表示}
\label{sub:ssl}
\paragraph{解决的机器学习问题。}本小节承接 \ref{sub:encode} 的单模态编码问题:\ref{sub:encode} 讲“数据如何被表示”,本小节进一步讲“这些表示如何通过学习获得”。现代生成式人工智能模型通常依赖大规模预训练。图像、语音和文本数据规模巨大,人工标注成本较高,因此\keyword{自监督学习}成为多模态表示学习的重要基础:它使模型能够从大规模未标注数据中获得可迁移的表征能力,为后续多模态对齐和指令微调提供基础。
\paragraph{图像怎么体现。}图像自监督主要有两条技术路线:
\begin{itemize}
\item \keyword{掩码图像建模}:随机遮挡部分 patch,让模型重建被遮挡内容,从而学习视觉结构与语义(代表:MAE、BEiT、SimMIM)。
\item \keyword{图像对比学习}:对同一图像的不同增强视图拉近表示、对不同图像推远表示,使模型在无标签条件下学到判别性特征(代表:SimCLR、MoCo、DINO)。
\end{itemize}
两类方法都说明:视觉表征的质量不仅来自模型规模,更来自预训练阶段形成的通用表示。
\paragraph{语音怎么体现。}
\todochen{讲解掩码语音预测、对比预测和离散语音单元学习等方法(如对比/掩码式自监督语音表征、离散声学单元 token 学习),说明语音模型如何从大量无标注语音中学习声学与语言相关表示;并与图像的掩码/对比两条路线相互对照。}
\paragraph{文本怎么体现。}文本方面,可讲语言建模和上下文预测,说明大语言模型如何通过预测任务形成通用语义表示。这一“用预测任务获得通用表示”的思想,正是图像掩码建模与语音掩码预测的共同来源。
\begin{importantnote}
本小节要强调:多模态生成式人工智能的能力不仅来自模型规模,也来自预训练阶段形成的\textbf{通用表示}。自监督学习把课程从“模型结构”推进到“训练目标与学习范式”层面。
\end{importantnote}
% ----------------------------------------------------------
\subsection{跨模态对齐学习}
\label{sub:align}
\paragraph{解决的机器学习问题。}本小节是 \ref{sec:repr} 的核心内容,讲解不同模态之间如何建立\keyword{语义对应关系}。图像、语音和文本虽然形式不同,但可以表达相同或相近的语义。例如,一张狗的图片、一句“a dog is running”的文本描述,以及一段包含狗叫声的音频,都可以在语义空间中形成关联。从机器学习角度看,跨模态对齐可以理解为一种\keyword{表示空间约束}:通过训练目标,使语义匹配的不同模态样本在向量空间中距离更近,使语义不匹配的样本距离更远。
\paragraph{图像怎么体现:图像—文本对齐。}图文对齐通常使用大规模图像—文本配对数据,通过\keyword{对比学习}把图像编码器和文本编码器映射到\keyword{共享语义空间}。以 CLIP 为代表,给定一个批次的 $N$ 对图文 $(I_i, T_i)$,先分别编码并归一化得到 $\mathbf{v}_i$(图像)和 $\mathbf{u}_i$(文本),以余弦相似度衡量匹配程度,使用对称的 InfoNCE(对比)损失:
\begin{equation}
\mathcal{L}_{\text{align}}
= -\frac{1}{2N}\sum_{i=1}^{N}
\left[
\log \frac{\exp(\langle \mathbf{v}_i,\mathbf{u}_i\rangle/\tau)}{\sum_{j=1}^{N}\exp(\langle \mathbf{v}_i,\mathbf{u}_j\rangle/\tau)}
+
\log \frac{\exp(\langle \mathbf{u}_i,\mathbf{v}_i\rangle/\tau)}{\sum_{j=1}^{N}\exp(\langle \mathbf{u}_i,\mathbf{v}_j\rangle/\tau)}
\right],
\label{eq:infonce}
\end{equation}
其中 $\langle\cdot,\cdot\rangle$ 为余弦相似度,$\tau$ 为温度系数。式~\eqref{eq:infonce} 把“对齐”量化为:对角线上的正样本相似度要高,非对角线的负样本相似度要低。代表模型有 CLIP、ALIGN、SigLIP 等。
\paragraph{语音/音频怎么体现。}
\todochen{讲解语音—文本对齐(可利用语音转写、语音翻译数据)与音频—文本对齐(可利用声音事件与文本描述之间的配对,如 CLAP 思想)。强调与图文对齐相同的对比/匹配学习本质,并对照式~\eqref{eq:infonce} 说明只是把图像编码器换成语音/音频编码器。}
\begin{importantnote}
讲授时要突出方法本质:\textbf{跨模态对齐不是简单把不同模态拼接在一起,而是通过目标函数学习不同模态之间的语义距离关系。}正负样本的构造、温度系数与共享语义空间,是理解检索、问答和条件生成的共同入口。
\end{importantnote}
% ----------------------------------------------------------
\subsection{跨模态融合与统一表示}
\label{sub:fusion}
\paragraph{解决的机器学习问题。}本小节承接 \ref{sub:align} 的跨模态对齐。对齐解决不同模态之间的语义对应,\keyword{融合}进一步解决多个模态如何\textbf{共同参与}模型计算。完成单模态表示、自监督预训练、跨模态对齐后,模型还需要在具体任务中综合利用不同模态的信息,让图像、语音和文本共同参与理解、推理和生成。
\paragraph{主要融合方式(以图文为典型)。}
\begin{itemize}
\item \keyword{早期融合}:在输入或低层特征阶段就把多模态组合。
\item \keyword{后期融合}:不同模态分别建模后再汇总结果。
\item \keyword{中间层融合与交叉注意力}:用交叉注意力让不同模态在语义层交互,更适合现代多模态大模型(代表:Flamingo 的 gated cross-attention)。
\item \keyword{统一 token 序列建模}:把图像 token、语音 token 与文本 token 组织到统一序列中由模型联合建模,是当前多模态基础模型的重要趋势(代表:BLIP-2 的 Q-Former 把视觉压缩为少量 query token 接入语言模型)。
\end{itemize}
\paragraph{与生成式人工智能的关系。}融合不仅支持理解任务,也支持\textbf{生成控制}:文本可以控制图像生成,语音指令可以控制图像编辑,图像内容可以辅助生成语音讲解。融合机制越有效,模型越容易在复杂场景中保持跨模态一致性。
\paragraph{语音/音频怎么体现。}
\todochen{说明语音 token 如何与图像 token、文本 token 一起进入统一序列或交叉注意力,参与多模态上下文建模;强调时间结构(语音)与空间结构(图像)在融合时的差异。}
\begin{importantnote}
\textbf{\ref{sec:repr}\ref{sec:foundation} 的承接关系}\ref{sec:repr} 是“表示与对齐层”,提供图像编码器、语音编码器和跨模态语义空间;\ref{sec:foundation} 是“模型结构与训练层”,讨论这些模块如何接入大语言模型,使模型具备看图、听音、理解语音、执行指令和多模态推理的能力。先有表示,才能对齐;先有对齐,才能融合;先有融合,才能构建多模态基础模型。
\end{importantnote}
% ============================================================
\section{多模态基础模型结构与训练方法}
\label{sec:foundation}
% ============================================================
\subsection*{本节内容定位}
本节讲解多模态基础模型的\keyword{结构设计和训练方法}。从机器学习角度看,多模态大模型不是简单叠加图像模型、语音模型和语言模型,而是要解决不同表示空间之间的\textbf{映射、融合和联合训练}问题。本节重点讨论三个核心问题:图像、语音/音频等非文本模态如何接入大语言模型;多模态模型如何通过预训练、微调和指令训练形成理解与推理能力;视觉、语音和文本如何在统一模型中进行联合建模。本节承接 \ref{sec:repr} 的表示学习与对齐学习,并为 \ref{sec:generation} 的条件生成建模提供基础——只有模型能够理解图像、语音和文本条件,后续才能进一步根据这些条件生成内容。
% ----------------------------------------------------------
\subsection{多模态基础模型的通用结构}
\label{sub:arch}
\paragraph{统一框架。}多模态基础模型的通用架构可以概括为:
\begin{center}
\fbox{\ \ 模态编码器\ \ $\rightarrow$\ \ 连接模块\ \ $\rightarrow$\ \ 大语言模型\ \ }
\end{center}
其中,\keyword{模态编码器}负责把图像、语音或音频转化为高层表示(视觉/语音 token);\keyword{连接模块}负责把这些表示映射到语言模型能够处理的空间;\keyword{大语言模型}负责完成语义理解、上下文推理和文本生成。
\paragraph{连接模块的几种形式。}非文本表示接入语言模型,常见做法包括:线性投影层、MLP 连接器、Adapter,以及交叉注意力连接器(如 Q-Former)。训练上可采用\textbf{冻结部分模块、只训练连接层、端到端微调}等不同策略——例如先冻结视觉编码器与语言模型、只训练连接器对齐表示空间,再做端到端指令微调。
\paragraph{机器学习要点。}本小节的重点是让学生理解:多模态基础模型的关键机器学习问题,是\textbf{不同模态表示空间之间的映射学习和联合优化},而不是把视觉、语音、语言模型当作彼此孤立的系统。代表系统:Flamingo、BLIP-2、LLaVA、MiniGPT-4。
\paragraph{语音/音频怎么体现。}
\todochen{说明语音/音频编码器如何通过同样的“编码器→连接模块→大语言模型”框架接入语言模型,并指出连续声学信号的时序压缩对连接模块的额外要求。}
% ----------------------------------------------------------
\subsection{视觉语言模型:图像理解中的多模态建模}
\label{sub:vlm}
\paragraph{解决的机器学习问题。}本小节以图像模态为重点,讲解\keyword{视觉语言模型(VLM)}的结构和训练方法。视觉语言模型的目标是让模型能够接收图像输入,并围绕图像内容进行描述、问答、推理和对话。从机器学习角度看,视觉语言模型的本质是\textbf{把视觉表示作为条件上下文,使语言模型能够在视觉条件下进行预测和生成},即建模 $p(\text{文本}\mid \text{图像})$
\paragraph{典型任务。}图像描述(captioning)、视觉问答(VQA)、图文推理、图像指令响应、多轮图文对话。这些任务统一体现为:视觉特征经压缩、映射后接入语言模型,再由语言模型在视觉条件下自回归生成文本。
\paragraph{视觉指令微调。}视觉语言模型经过图文预训练后,通常还需要通过\keyword{指令数据}学习人类任务格式,例如“请描述这张图片”“图中人物在做什么”“根据图中信息回答问题”等。视觉指令微调能够把模型的图像感知能力转化为可交互的任务执行能力,使模型从图文匹配和图像描述走向交互式图文理解。代表模型:LLaVA、InstructBLIP、Qwen-VL、GPT-4V。
\paragraph{常见问题。}还应提示\keyword{视觉幻觉}与鲁棒性问题:模型可能描述出图中不存在的物体,这与视觉特征压缩、语言先验过强有关,是后续对齐训练要缓解的对象。视觉语言模型在教育、医疗、遥感和工业检测中有广泛应用。
\begin{exercisebox}
\begin{enumerate}
\item 用一句话说明视觉语言模型为什么需要“视觉编码器 + 连接模块 + 语言模型”三者协同。
\item 说明 $p(\text{文本}\mid\text{图像})$ 与第~\ref{sec:generation}~节将讲的 $p(\text{图像}\mid\text{文本})$ 在条件与目标上的对偶关系。
\end{enumerate}
\end{exercisebox}
% ----------------------------------------------------------
\subsection{语音语言模型:语音理解中的序列建模}
\label{sub:slm}
\paragraph{解决的机器学习问题(框架)。}本小节与 \ref{sub:vlm} 对称:以语音模态为重点,讲解语音语言模型的结构和训练方法。图像主要体现空间结构,语音主要体现\textbf{时间结构};语音信号在时间上连续变化,同时包含语言内容、说话人信息、情感和环境噪声。因此语音语言模型的核心是\keyword{序列建模与语义映射}:先用语音编码器对连续声学信号进行压缩和表征,再映射到语言模型可处理的语义空间,在语言模型中完成上下文预测和指令响应。
\todochen{展开本小节正文:语音识别与语音理解;语音问答、语音翻译和语音对话;语音编码器与大语言模型连接;连续声学信号的时序压缩;语音 token 与文本 token 的对齐;语音指令微调;口语化、方言、噪声和重叠语音问题;以及语音语言模型在人机交互中的应用。讲述顺序建议从语音识别开始,再扩展到语音理解、语音问答和语音对话,使学生理解语音语言模型从“转写语音”发展到“理解语音指令并完成任务”的过程。代表模型可选 Whisper、SpeechGPT、Qwen-Audio、SALMONN 等。}
% ----------------------------------------------------------
\subsection{多模态指令微调与对齐训练}
\label{sub:instruct}
\paragraph{解决的机器学习问题。}多模态模型具备图像或语音输入能力后,还需要通过\keyword{指令微调}学习人类任务格式。指令微调使模型能够理解用户意图,并根据图像、语音、文本等条件完成问答、解释、推理、编辑和生成等任务。从机器学习角度看,多模态指令微调的作用是\textbf{把预训练模型的感知能力转化为任务执行能力}:预训练阶段学习模态表示和语义对应关系,指令微调阶段学习如何按照用户指令组织输入、调用上下文并生成符合要求的输出。
\paragraph{指令数据与训练范式。}
\begin{itemize}
\item \keyword{监督指令微调(SFT)}:构造图像问答、图像描述、图文推理等多模态指令数据,统一任务格式(图像侧代表:LLaVA-Instruct)。
\item \keyword{偏好对齐}:通过人类反馈强化学习(RLHF)或直接偏好优化(DPO)让输出更符合人类偏好与安全要求。
\item \keyword{鲁棒性与安全对齐}:缓解多模态幻觉,提升复杂指令下的视觉推理可靠性。
\end{itemize}
\paragraph{语音/音频怎么体现。}
\todochen{补充语音问答数据、语音翻译数据、语音对话数据和跨模态指令数据的构造方式,以及语音侧的多轮对话训练与安全对齐。}
\begin{importantnote}
指令微调把课程从“模型结构层面”推进到“训练范式层面”,也为后续可控生成和交互式生成打下基础:理解用户意图,是可控生成的前提。
\end{importantnote}
% ----------------------------------------------------------
\subsection{图像—语音—文本联合建模}
\label{sub:joint}
\paragraph{解决的机器学习问题。}本小节是 \ref{sec:foundation} 的综合部分,讲图像、语音和文本三类模态的\keyword{联合建模}。真实智能系统通常不只处理单一模态:视频中同时包含画面、声音和字幕;课堂教学中同时包含图像材料、教师语音和文本内容;智能助手可能需要根据用户语音指令理解图像,并通过文本或语音给出回答。
\paragraph{联合建模的挑战。}图像—语音—文本联合建模要求模型同时处理\textbf{空间结构、时间结构和符号结构}:图像提供视觉空间信息,语音提供时间动态和说话人信息,文本提供明确的语义和逻辑组织。多模态模型需要在统一上下文中综合这些信息,完成跨模态理解、推理和生成。这一小节让学生从双模态系统过渡到更完整的多模态基础模型系统。代表系统:GPT-4o、Gemini 等原生多模态模型。
\paragraph{语音/音频怎么体现。}
\todochen{补充视频中视觉、音频和字幕的融合、图像讲解与语音导览、多源信息融合与上下文保持等以语音/音频为核心的联合建模内容。}
\begin{importantnote}
\textbf{\ref{sec:foundation}\ref{sec:generation} 的承接关系}\ref{sec:foundation} 是“理解与交互层”,解决“多模态模型如何理解图像、语音和文本”;\ref{sec:generation} 是“生成与控制层”,解决“模型如何在给定条件下生成新内容”。多模态理解能力为条件生成提供输入基础,指令微调能力为可控生成提供交互基础。
\end{importantnote}
% ============================================================
\section{条件生成建模与多模态内容生成}
\label{sec:generation}
% ============================================================
\subsection*{本节内容定位}
本节讲解多模态生成式人工智能中的\keyword{条件生成建模}问题。从机器学习角度看,文本生成图像、图像编辑、语音合成、文本生成音频和跨模态交互生成,都可以统一理解为\textbf{条件分布学习}问题。其基本形式为:
\begin{equation}
\text{给定条件 } c,\ \text{学习目标模态 } x \text{ 的条件分布 } p(x \mid c),
\label{eq:cond}
\end{equation}
其中条件 $c$ 可以是文本、图像、语音、音频、用户指令或历史上下文;目标模态 $x$ 可以是图像、语音、音频或视频。本节讲述逻辑按生成建模难度逐步展开:
\begin{center}
条件生成基础\ $\rightarrow$\ 视觉内容生成\ $\rightarrow$\ 视觉内容编辑\ $\rightarrow$\ 语音内容生成\ $\rightarrow$\ 音频内容生成\ $\rightarrow$\ 跨模态交互生成。
\end{center}
% ----------------------------------------------------------
\subsection{条件生成模型基础}
\label{sub:genbasic}
\paragraph{解决的机器学习问题。}本小节从机器学习角度讲解\keyword{生成模型}\keyword{条件生成模型}的基本概念。生成模型的目标是学习数据分布 $p(x)$,并从该分布中采样生成新样本;条件生成模型进一步引入条件变量 $c$,使模型能够根据文本、图像、语音或其他输入,建模 $p(x\mid c)$,生成符合条件要求的目标模态内容。先区分\keyword{判别模型}(学习 $p(y\mid x)$,输入到标签或输出的映射)与\keyword{生成模型}(学习数据本身的分布结构)。
\paragraph{常见生成建模方法。}
\begin{longtable}{p{0.20\linewidth}p{0.40\linewidth}p{0.28\linewidth}}
\caption{常见生成建模方法对比}\label{tab:genfamily}\\
\toprule
方法 & 核心思想 & 代表 \\
\midrule
\endfirsthead
\toprule
方法 & 核心思想 & 代表 \\
\midrule
\endhead
自回归生成 & 按顺序逐 token 建模 $p(x)=\prod_t p(x_t\mid x_{<t})$ & PixelCNN、图像 token 自回归 \\
变分自编码器(VAE) & 引入隐变量,优化变分下界(ELBO) & VAE、VQ-VAE \\
生成对抗网络(GAN) & 生成器与判别器对抗训练 & StyleGAN \\
扩散模型 & 前向加噪、反向逐步去噪 & DDPM、Stable Diffusion \\
基于流的模型 & 可逆变换、显式密度 & Glow、Flow Matching \\
\bottomrule
\end{longtable}
这里不展开所有数学细节,重点让学生理解这些方法都在解决“如何建模并采样数据分布”的问题。
\paragraph{条件变量的多模态性。}在多模态生成任务中,条件变量尤为重要:文本可以作为图像生成条件,原图和编辑指令可以作为图像编辑条件,文本和说话人信息可以作为语音生成条件,图像、语音和历史上下文可以共同作为跨模态生成条件。本小节先把多模态内容生成统一到式~\eqref{eq:cond} 的条件生成框架中,再为后续图像生成、图像编辑、语音生成和音频生成提供共同理论入口,避免后续内容变成任务罗列。
% ----------------------------------------------------------
\subsection{视觉内容生成:文本生成图像}
\label{sub:t2i}
\paragraph{解决的机器学习问题。}本小节讲解文本生成图像任务,即建模
\begin{equation}
p(\text{图像}\mid \text{文本}).
\end{equation}
模型需要根据文本提示词中的主体、属性、动作、风格、布局和场景关系,生成与文本语义一致的图像。文本生成图像是条件生成建模在视觉模态中的典型体现。
\paragraph{扩散模型的去噪生成过程。}以扩散模型为主线说明视觉生成。前向过程对真实图像 $x_0$ 逐步加入高斯噪声,第 $t$ 步可写为
\begin{equation}
x_t = \sqrt{\bar\alpha_t}\,x_0 + \sqrt{1-\bar\alpha_t}\,\epsilon,\qquad \epsilon\sim\mathcal{N}(0,I),
\end{equation}
其中 $\bar\alpha_t$ 是噪声调度。反向过程训练一个网络 $\epsilon_\theta(x_t,t,c)$ 在文本条件 $c$ 下预测噪声,目标函数为
\begin{equation}
\mathcal{L}_{\text{diff}} = \mathbb{E}_{x_0,\epsilon,t}\big\|\,\epsilon - \epsilon_\theta(x_t,t,c)\,\big\|_2^2 .
\end{equation}
推理时从纯噪声出发,逐步去噪得到符合文本要求的图像。为提升计算效率,现代方法(如 Stable Diffusion)在\keyword{潜在空间}而非像素空间进行扩散。
\paragraph{文本条件如何改变生成分布(Classifier-free Guidance)。}文本条件通过文本编码器(如 CLIP 文本塔、T5)注入去噪网络。为增强语义一致性,常用\keyword{无分类器引导(Classifier-free Guidance, CFG)}:训练时随机丢弃条件,推理时把条件与无条件预测做外推,
\begin{equation}
\tilde{\epsilon}_\theta(x_t,c) = \epsilon_\theta(x_t,\varnothing) + w\,\big(\epsilon_\theta(x_t,c) - \epsilon_\theta(x_t,\varnothing)\big),
\label{eq:cfg}
\end{equation}
其中引导强度 $w$ 越大,生成结果越贴合文本,但多样性下降。式~\eqref{eq:cfg} 是“文本条件如何改变图像生成分布”这一核心问题的直接体现。代表模型:DALL$\cdot$E~2、Imagen、Stable Diffusion。
\begin{importantnote}
讲授时可将复杂数学适度简化,突出三个递进问题:文本生成图像的任务形式 $p(\text{图像}\mid\text{文本})$;文本条件如何进入生成模型;模型如何从噪声或潜在变量中逐步生成符合文本要求的图像。评价维度包括生成质量、多样性和语义一致性。
\end{importantnote}
% ----------------------------------------------------------
\subsection{视觉内容编辑:保持约束下的条件生成}
\label{sub:edit}
\paragraph{解决的机器学习问题。}与文本生成图像相比,\keyword{图像编辑}多了一个重要约束:模型需要在已有图像基础上进行修改。因此图像编辑可以表示为
\begin{equation}
p(\text{编辑后图像}\mid \text{原图},\ \text{编辑指令},\ \text{mask 或结构条件}).
\end{equation}
图像编辑的核心问题是如何在\textbf{保持原图主体、结构、身份或风格一致性}的同时,引入新的目标语义。例如,将图像背景替换为雪山时,模型需要改变背景内容,同时保持人物面部、姿态和主体结构。
\paragraph{典型任务与方法。}
\begin{itemize}
\item \keyword{图像修复与图像扩展}(inpainting / outpainting):基于 mask 在缺失区域条件生成。
\item \keyword{局部重绘与 mask 条件控制}:只在指定区域修改,保持其余部分不变。
\item \keyword{文本引导编辑}:用自然语言描述修改目标(代表:SDEdit、Prompt-to-Prompt)。
\item \keyword{指令式图像编辑}:直接给出编辑指令(代表:InstructPix2Pix)。
\item \keyword{结构控制与身份保真}:用边缘、深度、姿态等结构条件或参考图约束生成(代表:ControlNet、DreamBooth)。
\end{itemize}
\paragraph{评价要点。}图像编辑的质量不仅取决于生成内容是否真实,还取决于\textbf{编辑是否准确、原图信息是否保留、局部修改是否与整体一致}。这里应重点突出“生成目标”和“保持约束”之间的平衡:本小节承接 \ref{sub:t2i} 的视觉生成能力(从文本生成新图像),进一步讨论在原图约束下生成编辑结果,使学生理解生成模型不仅可以从零生成内容,也可以在已有内容基础上进行受控修改。
% ----------------------------------------------------------
\subsection{语音内容生成:序列条件生成与声学建模}
\label{sub:tts}
\paragraph{解决的机器学习问题(框架)。}本小节讲解语音生成任务。语音合成可以表示为
\begin{equation}
p(\text{语音}\mid \text{文本},\ \text{说话人},\ \text{风格},\ \text{情感}).
\end{equation}
语音生成与图像生成存在显著差异:图像主要是\textbf{空间结构生成},语音则是\textbf{连续时间序列生成}。语音合成不仅要准确表达文本内容,还要生成自然的音色、韵律、语速、停顿和情感。
\todochen{展开本小节正文:先讲文本到语音合成的基本流程(文本前端、声学模型和神经声码器),再进一步讲解现代生成式语音模型中的音色建模、韵律控制、情感控制、零样本语音合成和声音克隆;强调语音生成的目标不仅是“读出文字”,还包括生成自然、可懂、符合说话人特征和情感风格的连续声学信号;并对照 \ref{sub:t2i} 说明连续时间信号生成与视觉空间生成之间的差异。代表模型可选 Tacotron、VITS、VALL-E、NaturalSpeech 等。同时讨论语音生成的安全与伦理问题(如声音克隆滥用)。}
% ----------------------------------------------------------
\subsection{音频内容生成:声音事件与声景的条件生成}
\label{sub:t2a}
\paragraph{解决的机器学习问题(框架)。}本小节讲解一般音频生成任务。文本生成音频可以表示为
\begin{equation}
p(\text{音频}\mid \text{文本描述}).
\end{equation}
这里的音频范围比语音更广,包括环境声、音乐片段、声音事件和复杂声景。一般音频生成与语音合成都需生成连续声音信号,但语音具有明确的语言内容和发音规则,而一般音频更强调声音事件、环境结构、时间变化和声学真实感,因此建模难度更高。
\todochen{展开本小节正文:文本到音频生成、声音事件生成、声景生成、音频扩散模型和文本引导音频编辑;重点放在模型如何根据高层语义描述生成具有时间结构和声学真实感的音频;并说明本小节承接 \ref{sub:tts} 的声音生成问题,从语音扩展到一般音频。代表模型可选 AudioLDM、AudioGen、MusicGen 等。}
% ----------------------------------------------------------
\subsection{跨模态交互生成:多条件生成与可控生成}
\label{sub:anytoany}
\paragraph{解决的机器学习问题。}本小节是 \ref{sec:generation} 的综合部分,讲解多个模态共同参与生成过程的情况。跨模态交互生成可以表示为
\begin{equation}
p(\text{目标模态}\mid \text{文本},\ \text{图像},\ \text{语音},\ \text{历史上下文},\ \text{用户指令}).
\end{equation}
这一类任务已经从单一条件生成发展为\keyword{多条件、多模态、多轮交互生成}。例如,模型可以根据图像生成语音讲解,可以根据语音指令控制图像编辑,可以根据图像和文本联合生成音效,也可以在多轮对话中不断修改生成结果。
\paragraph{核心难点。}跨模态交互生成的难点在于不同模态的结构并不一致:图像强调空间结构,语音/音频强调时间结构,文本强调语义和逻辑结构。模型需要在生成过程中同时保持\textbf{语义对应、空间一致、时间一致和用户意图一致}。这与 \ref{sec:repr} 的跨模态对齐、\ref{sec:foundation} 的多模态理解前后呼应:先有统一表示和理解,才有可控的多模态生成。
\paragraph{图像侧的体现与代表系统。}图像到文本、文本到图像、图像生成语音讲解、语音控制图像编辑、图像和文本联合生成音频等,都是其具体形式。代表系统:GPT-4o、Gemini 等原生多模态模型,以及 CoDi、Emu 等任意模态到任意模态的生成框架。
\paragraph{语音/音频怎么体现。}
\todochen{补充以语音/音频为目标或条件的交互生成内容,如视频配音与图像讲解、语音驱动的多轮交互生成、跨模态一致性与可控性评价等。}
\begin{importantnote}
\textbf{\ref{sec:generation} 与后续应用专题的承接关系}\ref{sec:generation} 提供生成式模型方法,后续应用专题进一步讨论这些方法如何在真实场景中受到噪声、实时性、安全性、可靠性和可解释性等因素影响。图像、语音和音频生成模型提供了通用的跨模态内容生成能力,而复杂应用系统要求模型在更严格的环境中完成稳定、可信和可控的智能处理。
\end{importantnote}
% ============================================================
\section*{本讲整体逻辑总结}
\addcontentsline{toc}{section}{本讲整体逻辑总结}
% ============================================================
第五部分按照高级机器学习的主线组织,形成三个层次:
\begin{itemize}
\item \keyword{第一层 表示与对齐}\ref{sec:repr}):回答“图像、语音和文本如何被表示,如何通过学习进入统一语义空间”,对应表示学习、自监督和对齐学习。
\item \keyword{第二层 结构与训练}\ref{sec:foundation}):回答“图像、语音等非文本模态如何接入大语言模型,并形成理解、推理和指令响应能力”,对应模型结构设计、表示空间映射、指令微调和联合建模。
\item \keyword{第三层 生成与控制}\ref{sec:generation}):回答“模型如何在给定文本、图像、语音等条件下生成新的图像、语音和音频内容”,对应生成建模、条件分布学习、可控生成和跨模态交互生成。
\end{itemize}
\noindent 三者之间的逻辑关系是:
\begin{center}
\textbf{先有表示,才能对齐;先有对齐,才能融合;先有融合,才能构建多模态基础模型;先有多模态理解能力,才能实现可控的多模态生成。}
\end{center}
\noindent 因此,本讲的讲述重点不是简单介绍图像、语音和文本任务,而是从机器学习机制出发,解释多模态生成式人工智能系统如何形成:从数据表示到语义对齐,从模型结构到训练方法,从理解推理到条件生成,最终形成面向真实场景的图像—语音—文本联合智能系统。
\begin{importantnote}
\textbf{教学目标自查}:学完本讲后,应能够——理解图像、语音/音频和文本的基本表示方式;掌握多模态表示学习、自监督预训练和跨模态对齐的基本思想;理解视觉编码器、语音编码器与大语言模型的连接方式;掌握视觉语言模型和语音语言模型的基本结构与训练方法;理解多模态指令微调与对齐训练的作用;掌握条件生成建模的基本思想;理解文本生成图像、图像编辑、语音合成、文本生成音频和跨模态交互生成的主要技术路线;能够从表示学习、对齐学习、模型结构、训练方法和条件生成五个角度分析典型多模态生成式人工智能系统。
\end{importantnote}
Markdown 格式
0%
您添加了 0 到此讨论。请谨慎行事。
请先完成此评论的编辑!
注册 或者 后发表评论