中文

太有帮助、太无害、太诚实,还是恰到好处?

计算与语言 2025-09-16 v2

摘要

大语言模型(LLM)在广泛的 NLP 任务中表现出色,但与帮助性(Helpfulness)、无害性(Harmlessness)和诚实性(Honesty)三原则的对齐仍是一个持久的挑战。现有方法常针对单个对齐维度进行优化,导致权衡和不一致的行为。虽然混合专家(Mixture-of-Experts, MoE)架构提供了模块化优势,但由于路由校准不良,限制了其在对齐任务中的效果。我们提出了 TrinityX,一个模块化对齐框架,在 Transformer 架构中集成校准专家混合(Mixture of Calibrated Experts, MoCaE)。TrinityX 利用分别训练的专家处理每个 HHH 维度,通过校准的、任务自适应的路由机制将专家信号整合为统一的、对齐感知的表示。对三个标准对齐基准——Alpaca(帮助性)、BeaverTails(无害性)和 TruthfulQA(诚实性)进行的广泛实验表明,TrinityX 在强基准上超越表现,分别实现了 32.5% 的胜率提升、33.9% 的安全得分提升和 28.4% 的诚实性提升。此外,TrinityX 比先前的 MoE 方法在内存使用和推理延迟方面降低了超过 40%。消融研究凸显了校准路由的重要性,跨模型评估确认 TrinityX 在 diverse LLM 后端上的泛化能力。

关键词

引用

@article{arxiv.2509.08486,
  title  = {Too Helpful, Too Harmless, Too Honest or Just Right?},
  author = {Gautam Siddharth Kashyap and Mark Dras and Usman Naseem},
  journal= {arXiv preprint arXiv:2509.08486},
  year   = {2025}
}

备注

EMNLP'25 Main