Latest Notes

YANG's Blog

按时间整理的技术笔记、学习记录和工程实践。

知识库
3. GPU 异步计算

写 PyTorch 训练代码时,你会发现一些奇怪的现象:loss.backward() 后面紧跟一行 print(loss.item()),这一行突然变得很慢;明明用了 torch.cuda.synchronize() 测时间,profiler 里看到的耗时却完全不一样;DDP 训练里通信看似在反向

1. 训练显存预算与激活优化

训练大模型时,显存几乎永远是瓶颈。这一篇是整个 AI Infra 系列后续章节(DDP / ZeRO / Pipeline Parallel / Tensor Parallel)共同的问题陈述——先把”训练时显存到底被什么吃掉”算清楚,再讲两个最常用的工程降显存手段:Micro-batch / 梯度

Chapter 8. DDIM
2026-05-05 Diffusion Models

DDPM 把 diffusion 的训练目标做漂亮了,但留下了一个工程上的”痛”:采样要走 1000 步,生成一张图比 GAN 慢两个数量级。DDIM(Song et al. 2020,”Denoising Diffusion Implicit Models”)在不重新训练的前提下,用同一个网络把采

Chapter 7. Score SDE
2026-05-04 Diffusion Models

这一讲是 diffusion 数学的”加冕时刻”——把变分线(DDPM 那一讲)和 score 线(NCSN 那一讲)正式统一在一个连续时间的随机微分方程框架下。Song et al. 2021 的论文 “Score-Based Generative Modeling through Stochas

Chapter 4. Score-based Models
2026-05-01 Diffusion Models

好,我们正式进入第二讲:Score Matching。我会按你熟悉的节奏走——动机、数学、关键洞察、和后面的衔接。 这条线的核心问题始终是同一个:如何建模数据分布 $p(x)$。但和第一讲的变分推断完全不同的思路——不学 $p(x)$,而学 $\nabla_x \log p(x)$。 一、动机:为什

Chapter 2. EM & VAE
2026-05-01 Diffusion Models

上一讲我们把 ELBO 和变分推断这个数学骨架立起来了。这一讲讲两个站在这个骨架上的经典模型:EM 算法(经典隐变量模型的标准训练工具)和 VAE(深度学习版的隐变量模型)。理解这两个,后面 diffusion 是一脉相承。 我会按这个顺序展开: EM 算法:动机、推导、收敛性 GMM 上的 EM:

2026年5月 日记
2026-05-01 日记

5.15 孩子们,写日记确实难坚持捏 与Claude洽谈完,建议碰到什么困难都直接清楚明白地写下来,这样能把模糊的恐惧化为精准的行动

4 / 22