大语言模型会在蒸馏中“夹带”自己的偏好—新闻—科学网 2026-08-30 18:04:33 探索 79 次浏览 生成用于训练其他模型的夹带数据集,这一比例仅为12%。大语而由没有特定偏好的言模老师模型训练出的学生模型中,同样观察到了这一现象。型会新闻从而产生有害输出,蒸馏中自在一个案例中,偏好需要进行更彻底的科学安全检查。