Latest Notes

YANG's Blog

按时间整理的技术笔记、学习记录和工程实践。

知识库
Chapter 1. 贝叶斯 & 变分推断
2026-05-01 Diffusion Models

数学知识打底之后,我们要把”为什么 diffusion 长这个样子”的根本数学骨架讲清楚:贝叶斯推断 → 隐变量框架 → 变分推断 → ELBO。后续 DDPM、Score SDE、VAE 全部都站在这条逻辑链上。 1. 一切的源头:贝叶斯推断算不动1.1 贝叶斯推断的基本设定我们有: 先验 $p(

Chapter 0. 数学知识
2026-05-01 Diffusion Models

整套 diffusion 笔记的数学打底。这一讲只放纯数学工具——后面所有概率部分(贝叶斯/变分推断/EM/VAE/DDPM/Score SDE)都会反复用到这里。读完这章你不会立刻看见 diffusion 的样子,但后面公式不再让你卡住。 1. 核心动机:为什么是”扩散”?2015 年之前,生成模

Chapter 6. DDPM
2026-05-01 Diffusion Models

这一讲是整个 diffusion 系列里最关键、最优美的一讲——它把 Sohl-Dickstein 的”理论上正确但实际不好用”的框架,改造成了”现代 diffusion 的标准形式”。所有后续工作(Stable Diffusion、Imagen、SDXL、FLUX 等)都建立在 DDPM 之上。

2. Distributed Data Parallel

一、从 DP 到 DDP:数据并行的演进数据并行能成立的数学根基只有一行:把 batch 切给 N 张卡分别算梯度再平均,等价于单卡跑完整 batch。 \nabla L(\theta) = \frac{1}{B}\sum_{i=1}^B \nabla \ell(x_i,\theta) = \fra

5. ZeRO 与 FSDP

ZeRO 是 DeepSpeed 团队在 2019 年提出的显存优化方案,核心思想是消除数据并行中的显存冗余。DDP 让每张卡都存完整的模型参数、梯度、优化器状态,这些是冗余的——ZeRO 把它们分片到不同卡上,大幅降低单卡显存占用,让训练超大模型成为可能。PyTorch 原生的 FSDP (Ful

AI Infra学习计划
2026-04-23 日记

AI Infra 学习清单(按技术栈分类)按 公用 → 推理 → 训练 三大块组织,每块内部分 ⚡速通(面试高频,优先学)和 🐢慢补(基础功底,长期积累)。 一、公用技术栈这部分是无论做推理还是训练都必须掌握的,性价比最高。 ⚡ 速通部分(面试高频)1. Transformer 与 LLM 原理

1. Flash Attention

1.FlashAttention 整体结构FlashAttention 是由斯坦福大学 Tri Dao 等人在 2022 年提出的一种精确(非近似)的注意力计算算法。它通过重新设计注意力的计算方式,大幅降低了显存占用并加速了训练与推理,现已成为现代大模型(如 GPT、LLaMA 等)的标配。 一、问

用 config.json 自定义侧边栏分组名称
2026-04-20 博客搞建

本文记录了为分类页侧边栏增加「自定义分组名称」功能的完整实现。只需在子文件夹中放一个 config.json,侧边栏就会用其中定义的 name 字段替换原始文件夹名,无需修改任何模板。 1. 需求背景之前实现的侧边栏已经能按文件夹层级自动分组,但分组标签直接取自文件夹名——例如 Dynamic_Pr

5 / 22