1. 06 Jul, 2026 1 commit
    • 第五讲:完善图像部分内容与配图(按多轮评审意见) · 825aff67
      - 结构:删去引言/本讲小结,仅保留 5.1/5.2/5.3 三部分(含学习目标)
      - 语言:改为研究生教材口吻、软化绝对化表述、修正中文引号
      - 5.1 表示学习:补充数据原始形式(像素/振幅/词表)、向量空间与相似度、卷积(公式)、token 概念,并强化文本表征(基准语义空间)
      - 图示:新增/重画多张 TikZ 配图并对着图讲——三模态原始形式、向量空间、卷积、文本表示流程、三类融合(Emu/BLIP-2/LLaVA)、通用结构(含文本输入)、视觉语言模型及三种连接模块(线性投影/Q-Former/门控交叉注意力)、扩散去噪、图像编辑
      - 代表工作与发展脉络梳理,参考文献改用 \cite/\bibitem 汇入全书参考资料,逐条核对并补齐(含 Emu 等)
      - 逐图高分辨率核验无重叠;XeLaTeX 编译通过(28 页)
      语音/音频小节保留 \todochen 占位待陈丹补充。
      赵润松 committed
  2. 30 Jun, 2026 1 commit
    • 第五讲:多模态机器学习与生成式人工智能(框架+图像部分) · 6409ff87
      按组长大纲与第五部分PDF搭建第五讲整体结构,拆分为 chapters/ch5_multimodal.tex 由主文件引入:
      - 5.1 表示学习与跨模态对齐:单模态编码、自监督预训练、跨模态对齐(含CLIP InfoNCE损失)、跨模态融合
      - 5.2 基础模型结构与训练:通用结构、视觉语言模型、指令微调、图像-语音-文本联合建模
      - 5.3 条件生成建模:条件生成基础、文生图(扩散+CFG公式)、图像编辑、跨模态交互生成
      - 全程以机器学习问题为主线,图像内容写实,语音/音频小节用 \todochen 占位待陈丹补充
      XeLaTeX 编译通过。
      赵润松 committed
  3. 20 Jun, 2026 1 commit