本章定位:2024–2026 年 LLM 对齐的主流方向。DPO 用一个漂亮的数学推导砍掉了 RM 和 Critic,把 RL 问题变成纯监督学习。Llama 3、Mistral、Qwen 2.5 都以 DPO 为主。 承上:Ch6 §A.1 的 Bradley-Terry 模型 + Ch6 §A
Latest Notes
YANG's Blog
按时间整理的技术笔记、学习记录和工程实践。
1.用户行为日志字段在推荐系统中,数据决定了模型效果的上限。用户行为日志(User Behavior Logs)不仅是训练数据的来源,更是理解用户意图的唯一窗口。 1. 核心字段总览表 字段类别 关键字段 含义 面试深度视角 (Deep Dive) 主体标识 User_ID 唯一标识用户 ID 稀疏
4.03 Friday 把Inference-Time Scaling实验跑完了,没想到自己改进的效果提升了不少。 4.04 Saturday心情 =.=一觉醒来11点半….. 做完了演讲用的Slide:) 把Comfy UI 的环境给搭建了 把博客收拾了一下 准备推荐算法的面试 To Do 学习一
本章定位:从表示学习(Ch1–Ch4)跨入生成模型对齐(Ch5–Ch8)的第一站。SFT 是把”只会预测下一个词”的 Base Model 转变为”能听懂指令”的 Assistant 的关键步骤;LoRA/QLoRA/DoRA 是当今所有微调任务的工程标配。 承上:Ch1 §6 的交叉熵 = SF
本章定位:完全不同于 Ch2/Ch3 的”有负样本”路线,本章探讨完全不需要负样本的自监督方法。BYOL/SimSiam/DINO 给出的答案:只要打破对称性(Stop-gradient + Predictor),模型就不会塌缩。这套机制是 Ch6 RLHF Reference Policy 设计
本章定位:把 Ch2 的 InfoNCE 推广到 (1) 跨模态——CLIP 用图文对训练,成为多模态 LLM 的视觉骨干;(2) 文本——SimCSE 把 InfoNCE 引入 NLP,BGE/E5 训出现代 RAG 检索器。 承上:Ch2 §A 的 InfoNCE 损失、§B 的 In-bat
本章定位:从 Ch1 的”点之间的相似度”过渡到”用相似度训练表征模型”。SimCLR/MoCo 是对比学习的两个奠基性工作,它们的损失函数(InfoNCE)和训练范式直接影响了后来的 CLIP(Ch3)和所有现代 embedding 模型。 承上:基于 Ch1 §3 的点积相似度和 §6 的交叉
本章定位:整套笔记的”数学地基”。后续所有章节(Attention、InfoNCE、PPO KL 惩罚、DPO 闭式解)都建立在本章的相似度/散度公式之上。 §A 数学原理1. 欧氏距离 (Euclidean Distance) —— 绝对位置的度量欧氏距离是最基础的 $L_2$ 范数,衡量 $n
学习自https://pytorch.org/tutorials/beginner/basics/quickstart\_tutorial.html 导入并预处理数据集pytorch中数据导入和预处理主要用torch.utils.data.DataLoader 和 torch.utils.data.
Pytorch学习笔记#1:拟合函数/梯度下降学习自https://pytorch.org/tutorials/beginner/pytorch\_with\_examples.html 概念Pytorch Tensor在概念上和Numpy的array一样是一个nnn维向量的。不过Tensor可以在