中文

专家人格提升LLM对齐但降低准确性:使用PRISM进行意图基准人格路由的自启动

人工智能 2026-03-20 v1

摘要

人格提示可引导LLM生成朝向特定领域的语调和模式。这种行为使多智能体系统中实现多样化交互以及需要高级人类对齐的人机任务成为可能。先前的工作对其实用性提供了混合意见:一些报告在特定领域使用专家人格时获得性能提升并贡献数据多样性,另一些则发现对一般实用性几乎没有或负面影响。要充分利用人格的优势并避免其有害性,必须深入研究其机制。本文研究了模型优化、任务类型、提示长度和放置如何影响指令调校和推理LLM上的专家人格有效性,并提供关于专家人格何时失败何时成功的见解。基于我们的发现,我们开发了一个充分利用专家人格优势的管道,命名为PRISM(意图基准自模型人格路由),通过一种无需外部数据、模型或知识的自启动过程,将意图条件化的专家人格蒸馏到带掩码的LoRA适配器中。PRISM在保持判别性任务准确性的同时,提升了生成任务上的人类偏好和安全对齐,同时具有最小的内存和计算开销。

关键词

引用

@article{arxiv.2603.18507,
  title  = {Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM},
  author = {Zizhao Hu and Mohammad Rostami and Jesse Thomason},
  journal= {arXiv preprint arXiv:2603.18507},
  year   = {2026}
}