中文

面向长文本生成的多组 Uncertain 量化

计算与语言 2024-08-01 v1 信息检索 社会与信息网络

摘要

尽管已有研究展示了不确定性量化可应用于大型语言模型(LLM)输出,但是否存在结果保证在子数据分组中的 validity 仍是未知问题。本文针对LLM生成的长文本,分别从 individual claims 层级(通过校准)和整个输出层级(通过共轭预测)进行不确定性研究。我们以人物传记生成为研究平台,为每一次生成推导一组(人口学)属性(例如,文本描述的是男性还是女性),以形成此类“子组”数据。我们发现,尽管对整个数据集进行标准化方法在校准和共轭预测方面表现良好,但在特定子组中这些保证会失效。建立了此问题后,我们采用基于子组的不确定性量化方法——多校准(multicalibration)和多validity 共轭预测——发现在各种方法中,额外的子组信息在子组内持续改善校准和共轭预测效果(关键在于仍保持整个数据集的保证)。由于校准、共轭预测及其多组方法在长文本生成语境中尚未得到广泛探索,本文的结果可视为该场景的基准。

关键词

引用

@article{arxiv.2407.21056,
  title  = {What Matters in Explanations: Towards Explainable Fake Review Detection Focusing on Transformers},
  author = {Md Shajalal and Md Atabuzzaman and Alexander Boden and Gunnar Stevens and Delong Du},
  journal= {arXiv preprint arXiv:2407.21056},
  year   = {2024}
}