$$ \begin{aligned}\mathrm{KL}(p_{\text{data}}\,\|\,\pi_\theta)&=\mathbb{E}{(x,y)\sim p{\text{data}}}\Big[\log p_{\text{data}}(y\mid x)-\log\pi_\theta(y\mid x)\Big]\\[6pt]&=\underbrace{\mathbb{E}{p{\text{data}}}\big[\log p_{\text{data}}(y\mid x)\big]}{=-H(p{\text{data}})\text{,与}\theta\text{无关}}\;-\;\underbrace{\mathbb{E}{p{\text{data}}}\big[\log\pi_\theta(y\mid x)\big]}_{\text{只有这一项含}\theta}\end{aligned} $$
$$ \mathbb{E}{(x,y)\sim p{\text{data}}}\big[\log\pi_\theta(y\mid x)\big]\;\approx\;\frac1N\sum_{i=1}^{N}\log\pi_\theta(y_i\mid x_i) $$
$$ \arg\min_\theta\mathrm{KL}(p_{\text{data}}\,\|\,\pi_\theta)\;=\;\arg\max_\theta\mathbb{E}{(x,y)\sim p{\text{data}}}\big[\log\pi_\theta(y\mid x)\big]\;\approx\;\arg\max_\theta\frac1N\sum_{i=1}^{N}\log\pi_\theta(y_i\mid x_i) $$
$$ \exp\Big(\sum_{i=1}^{N}\log\pi_\theta(y_i\mid x_i)\Big)=\prod_{i=1}^{N}\pi_\theta(y_i\mid x_i)=:\mathcal{L}(\theta) $$
$\mathcal{L}(\theta)$叫似然(likelihood):模型给这 $N$条数据的联合概率,看成 $\theta$的函数。连乘成立是因为样本独立
exp 单调递增,不改变 argmax,所以 $\arg\max_\theta\frac1N\sum_i\log\pi_\theta(y_i\mid x_i)=\arg\max_\theta\mathcal{L}(\theta)$
所以SFT本身是一个对 $\theta$ 的MLE(maximum likelihood estimation,极大似然估计)的过程
$$ \hat{\theta} = \arg\max_\theta \mathcal{L}(\theta), \quad \mathcal{L}(\theta) = \prod_{i=1}^{N} \pi_\theta(y_i \mid x_i)
$$
loss 取负 log,叫 NLL(negative log-likelihood)