数学知识打底之后,我们要把”为什么 diffusion 长这个样子”的根本数学骨架讲清楚:贝叶斯推断 → 隐变量框架 → 变分推断 → ELBO。后续 DDPM、Score SDE、VAE 全部都站在这条逻辑链上。 1. 一切的源头:贝叶斯推断算不动1.1 贝叶斯推断的基本设定我们有: 先验 $p(
Latest Notes
YANG's Blog
按时间整理的技术笔记、学习记录和工程实践。
整套 diffusion 笔记的数学打底。这一讲只放纯数学工具——后面所有概率部分(贝叶斯/变分推断/EM/VAE/DDPM/Score SDE)都会反复用到这里。读完这章你不会立刻看见 diffusion 的样子,但后面公式不再让你卡住。 1. 核心动机:为什么是”扩散”?2015 年之前,生成模
1. 模型框架的全貌这是 diffusion model 真正的”鼻祖”论文:”Deep Unsupervised Learning using Nonequilibrium Thermodynamics”。 核心思想来自统计物理:任何复杂分布 q(x0)q(x_0)q(x0),只要慢慢加噪声,最
这一讲是整个 diffusion 系列里最关键、最优美的一讲——它把 Sohl-Dickstein 的”理论上正确但实际不好用”的框架,改造成了”现代 diffusion 的标准形式”。所有后续工作(Stable Diffusion、Imagen、SDXL、FLUX 等)都建立在 DDPM 之上。
一、从 DP 到 DDP:数据并行的演进数据并行能成立的数学根基只有一行:把 batch 切给 N 张卡分别算梯度再平均,等价于单卡跑完整 batch。 \nabla L(\theta) = \frac{1}{B}\sum_{i=1}^B \nabla \ell(x_i,\theta) = \fra
ZeRO 是 DeepSpeed 团队在 2019 年提出的显存优化方案,核心思想是消除数据并行中的显存冗余。DDP 让每张卡都存完整的模型参数、梯度、优化器状态,这些是冗余的——ZeRO 把它们分片到不同卡上,大幅降低单卡显存占用,让训练超大模型成为可能。PyTorch 原生的 FSDP (Ful
AI Infra 学习清单(按技术栈分类)按 公用 → 推理 → 训练 三大块组织,每块内部分 ⚡速通(面试高频,优先学)和 🐢慢补(基础功底,长期积累)。 一、公用技术栈这部分是无论做推理还是训练都必须掌握的,性价比最高。 ⚡ 速通部分(面试高频)1. Transformer 与 LLM 原理
1.FlashAttention 整体结构FlashAttention 是由斯坦福大学 Tri Dao 等人在 2022 年提出的一种精确(非近似)的注意力计算算法。它通过重新设计注意力的计算方式,大幅降低了显存占用并加速了训练与推理,现已成为现代大模型(如 GPT、LLaMA 等)的标配。 一、问
本文记录了为分类页侧边栏增加「自定义分组名称」功能的完整实现。只需在子文件夹中放一个 config.json,侧边栏就会用其中定义的 name 字段替换原始文件夹名,无需修改任何模板。 1. 需求背景之前实现的侧边栏已经能按文件夹层级自动分组,但分组标签直接取自文件夹名——例如 Dynamic_Pr
本文记录了为博客分类页面(/categories/xxx/)新增固定侧边栏的完整实现过程。侧边栏固定在视口左侧,显示当前分类下的全部文章(不受分页限制),按文件夹层级自动分组(支持两级嵌套),支持折叠展开,分组默认收起。 1. 需求背景博客的 ACM-ICPC 分类下有 100+ 篇文章,分 10