中文

通过提示大型语言模型学习可解释的文体嵌入

计算与语言 2023-10-11 v2

摘要

文体表示学习构建文本中作者文体的内容无关表示。文体测量学(stylometry),即文本文体的分析,通常由专家司法语言学家执行,且不存在用于训练的大型文体测量标注数据集。当前文体表示学习使用神经方法将文体与内容解耦以创建文体向量,然而这些方法导致不可解释的表示,使其在与审计和可解释性至关重要的下游应用(如作者归属)中的使用复杂化。在这项工作中,我们使用提示对大量文本执行文体测量以创建一个合成数据集,并训练我们称为 LISA 嵌入的人类可解释文体表示。我们发布我们的合成文体测量数据集与可解释文体模型作为资源。

关键词

引用

@article{arxiv.2305.12696,
  title  = {Learning Interpretable Style Embeddings via Prompting LLMs},
  author = {Ajay Patel and Delip Rao and Ansh Kothary and Kathleen McKeown and Chris Callison-Burch},
  journal= {arXiv preprint arXiv:2305.12696},
  year   = {2023}
}