中文

让导师人格“说话”:通过偏好优化从对话中学习引导向量

计算与语言 2026-02-10 v1

摘要

随着大型语言模型(LLM)作为强大的生成式人工智能(AI)类的出现,其在辅导中的应用日益增长。先前的LLM-based辅导工作通常学习单一的导师策略,无法捕捉辅导风格的多样性。在真实世界的导师-学生互动中,教育意图通过自适应教学策略实现,导师会根据学习者的需求调整支架水平、教学直接性、反馈和情感支持等,这些差异都可能影响对话动态和学生参与度。本文探索了如何使用嵌入在人类导师-学生对话中的导师人格来指导LLM行为,而无需依赖显式的提示指令。我们修改双向偏好优化(BiPO),学习一种引导向量——一种引导模型响应朝向特定导师人格的激活空间方向。我们发现,这种引导向量在对话情境中捕捉了导师特有的差异,提高了与真实导师言语的语义对齐度,提升了基于偏好的评估,同时在词汇相似性方面基本保持了一致。对所学定向系数的分析进一步揭示了导师之间可解释的结构,对应于导师行为的持久差异。这些结果表明,激活引导为使用源自人类对话数据派生的信号,有效且可解释地控制LLM中导师特定变异提供了可能。

关键词

引用

@article{arxiv.2602.07639,
  title  = {Letting Tutor Personas "Speak Up" for LLMs: Learning Steering Vectors from Dialogue via Preference Optimization},
  author = {Jaewook Lee and Alexander Scarlatos and Simon Woodhead and Andrew Lan},
  journal= {arXiv preprint arXiv:2602.07639},
  year   = {2026}
}