基于提示优化和学习集成的鲁棒人格感知有害内容检测
计算与语言
2026-01-06 v1
摘要
有害内容检测本质上具有主观性,受不同人口统计特征群体不同视角和社会先验的影响。虽然“ pluralistic ”建模作为一种方法从经济学和社会科学中捕捉不同情境下的视角差异,但当前的大型语言模型 (LLM) 提示技术在不同人格和基模型之间表现不同。本文系统评估了人格感知的有害内容检测,表明没有单一的提示方法,包括我们提出的自动提示优化策略,能在所有模型-人格对上统一占优。为充分利用互补误差,我们探索了四种提示变体的集成,并提出一种轻量级的元集成方法:基于 4 位预测向量的支持向量机 (SVM)。我们的结果表明,所提出的 SVM 集成在 diverse 人格上 consistently 优于单个提示方法和传统的多数投票技术,实现了最强的整体性能。本工作提供了人格条件化提示用于有害内容检测的首个系统性比较,并为主观 NLP 任务提供了鲁棒的 pluralistic 评估方法。
引用
@article{arxiv.2601.02337,
title = {Robust Persona-Aware Toxicity Detection with Prompt Optimization and Learned Ensembling},
author = {Berk Atil and Rebecca J. Passonneau and Ninareh Mehrabi},
journal= {arXiv preprint arXiv:2601.02337},
year = {2026}
}