中文

LinEAS:基于分布式損失的激活導向端到端學習

计算与语言 2025-10-20 v3 人工智能

摘要

生成模型在日常生活中的應用日益增多,從而呼籲實現高效的生成控制機制,以例如產生安全內容或為用戶提供探索風格變化的工具。理想狀態下,這些機制應要求少量無標籤數據(即無明確偏好),且在訓練和推理時間上都應具有成本效益,同時保持輸出質量。近期研究表明,僅通過對模型激活進行干預即可獲得此類機制,其目的是校正使用來源提示組與目標組(例如有毒與非有毒句子)時看到的激活之間的分布差異。儘管此類方法成本低廉,但本質上仍較粗糙:其映射是在局部調整的,未考慮其對下游層的影響,導致在超出樣本範圍時會引發意外的偏移。我們提出了線性激活導向端到端學習(LinEAS),一種使用考慮所有層級分布擔差的全局損失進行訓練的方法。除了更具魯棒性外,用於訓練 LinEAS 的損失函數可以與稀疏化規則正則化,從而自動完成神經元選取。LinEAS 只需少量無標籤樣本即可發揮作用,在語言模型的有毒性緩解方面超越類似基線方法,在具備強監督資源的情況下與 oracle 相當。LinEAS 是模態無關的,我們實驗發現它在緩解單步文本到圖像生成模型輸出中的新概念及其它概念方面優於現有的激活導向方法。

关键词

引用

@article{arxiv.2503.10679,
  title  = {LinEAS: End-to-end Learning of Activation Steering with a Distributional Loss},
  author = {Pau Rodriguez and Michal Klein and Eleonora Gualdoni and Valentino Maiorca and Arno Blaas and Luca Zappella and Marco Cuturi and Xavier Suau},
  journal= {arXiv preprint arXiv:2503.10679},
  year   = {2025}
}

备注

NeurIPS 2025