文本自注意力网络:通过基于文本梯度的注意力进行测试时偏好优化
计算与语言
2025-12-15 v2 人工智能
摘要
大型语言模型(LLMs)展现了卓越的泛化能力,但将其输出与人类偏好对齐通常需要昂贵的监督微调。最近的测试时方法利用文本反馈来克服这一点,但它们通常批评和修改单个候选响应,缺乏一种有原则的机制来系统地分析、权衡和综合多个有希望的候选响应的优势。这种机制至关重要,因为不同的响应可能在不同的方面表现出色(例如,清晰度、事实准确性或语气),而结合它们的最佳元素可能会产生远为优越的结果。本文提出了文本自注意力网络(TSAN),这是一种无需参数更新的测试时偏好优化的新范式。TSAN完全在自然语言中模拟自注意力以克服这一差距:它通过将多个候选响应格式化为文本键和值来分析它们,使用基于LLM的注意力模块权衡它们的相关性,并在学习到的文本注意力指导下将它们的优势综合成一个新的、与偏好对齐的响应。整个过程在文本梯度空间中运行,实现了迭代和可解释的优化。实证评估表明,在基础SFT模型上仅进行三次测试时迭代,TSAN就优于像Llama-3.1-70B-Instruct这样的监督模型,并通过有效利用多个候选解决方案超越了当前最先进的测试时对齐方法。
引用
@article{arxiv.2511.06682,
title = {Textual Self-attention Network: Test-Time Preference Optimization through Textual Gradient-based Attention},
author = {Shibing Mo and Haoyang Ruan and Kai Wu and Jing Liu},
journal= {arXiv preprint arXiv:2511.06682},
year = {2025}
}
备注
AAAI2026