第五讲:多模态机器学习与生成式人工智能(框架+图像部分)
按组长大纲与第五部分PDF搭建第五讲整体结构,拆分为 chapters/ch5_multimodal.tex 由主文件引入: - 5.1 表示学习与跨模态对齐:单模态编码、自监督预训练、跨模态对齐(含CLIP InfoNCE损失)、跨模态融合 - 5.2 基础模型结构与训练:通用结构、视觉语言模型、指令微调、图像-语音-文本联合建模 - 5.3 条件生成建模:条件生成基础、文生图(扩散+CFG公式)、图像编辑、跨模态交互生成 - 全程以机器学习问题为主线,图像内容写实,语音/音频小节用 \todochen 占位待陈丹补充 XeLaTeX 编译通过。
正在显示
chapters/ch5_multimodal.tex
0 → 100644
请
注册
或者
登录
后发表评论