写 PyTorch 训练代码时,你会发现一些奇怪的现象:loss.backward() 后面紧跟一行 print(loss.item()),这一行突然变得很慢;明明用了 torch.cuda.synchronize() 测时间,profiler 里看到的耗时却完全不一样;DDP 训练里通信看似在反向
Latest Notes
YANG's Blog
按时间整理的技术笔记、学习记录和工程实践。
训练大模型时,显存几乎永远是瓶颈。这一篇是整个 AI Infra 系列后续章节(DDP / ZeRO / Pipeline Parallel / Tensor Parallel)共同的问题陈述——先把”训练时显存到底被什么吃掉”算清楚,再讲两个最常用的工程降显存手段:Micro-batch / 梯度
本系列定位:从强化学习的思想起源讲起,建立完整的知识树。每章按”数学原理 → 模型架构 → 训练与推理“三视角组织。最终落到 LLM 时代的 RLHF、DPO、GRPO(与《学习笔记-大模型》系列形成双向链接)。 §A 起源叙事:百年思想史A.1 时间轴1234567891011121314151
全景导读这套笔记的目标是从数学原理 → 模型结构 → 训练与推理三个视角,串起一条清晰的 LLM 训练全链路:从最底层的距离/散度数学,到表示学习的各种范式,再到现代大模型对齐方法。 学习路径12345678910111213141516171819202122232425262728293031
DDPM 把 diffusion 的训练目标做漂亮了,但留下了一个工程上的”痛”:采样要走 1000 步,生成一张图比 GAN 慢两个数量级。DDIM(Song et al. 2020,”Denoising Diffusion Implicit Models”)在不重新训练的前提下,用同一个网络把采
这一讲是 diffusion 数学的”加冕时刻”——把变分线(DDPM 那一讲)和 score 线(NCSN 那一讲)正式统一在一个连续时间的随机微分方程框架下。Song et al. 2021 的论文 “Score-Based Generative Modeling through Stochas
好,我们正式进入第二讲:Score Matching。我会按你熟悉的节奏走——动机、数学、关键洞察、和后面的衔接。 这条线的核心问题始终是同一个:如何建模数据分布 $p(x)$。但和第一讲的变分推断完全不同的思路——不学 $p(x)$,而学 $\nabla_x \log p(x)$。 一、动机:为什
上一讲我们把 ELBO 和变分推断这个数学骨架立起来了。这一讲讲两个站在这个骨架上的经典模型:EM 算法(经典隐变量模型的标准训练工具)和 VAE(深度学习版的隐变量模型)。理解这两个,后面 diffusion 是一脉相承。 我会按这个顺序展开: EM 算法:动机、推导、收敛性 GMM 上的 EM:
一、NCSN 是什么NCSN = Noise Conditional Score Network(噪声条件 score 网络) 是 Yang Song(就是 Score SDE 的作者)和 Stefano Ermon 在 2019 年提出的方法,论文 “Generative Modeling by
5.15 孩子们,写日记确实难坚持捏 与Claude洽谈完,建议碰到什么困难都直接清楚明白地写下来,这样能把模糊的恐惧化为精准的行动