SubjECTive-QA:通过六维特征分析衡量财报电话会议问答记录中的主观性
计算与语言
2025-01-24 v2 人工智能
摘要
事实核查在虚假信息和错误信息的背景下得到了广泛研究,旨在解决客观上的不准确。然而,一种较温和的虚假信息形式涉及在事实上正确但缺乏某些特征(如清晰性和相关性)的回答。这一挑战在金融、政治、体育等领域的新闻发布会等正式问答设置中普遍存在,其中主观回答可能会掩盖透明度。尽管如此,目前仍缺乏跨多个维度的主观特征人工标注数据集。为了填补这一空白,我们引入了 SubjECTive-QA,一个关于财报电话会议问答环节的人工标注数据集,因为公司代表给出的回答通常容易受到主观解释和审查。该数据集包含针对长篇问答对的 49,446 个标注,涵盖六个特征:断言性、谨慎性、乐观性、具体性、清晰性和相关性。这些特征经过精心挑选,涵盖了反映不同领域问答环节中所提供回答基调的关键属性。我们的发现是,表现最好的预训练语言模型RoBERTa-base 在主观性较低的特征(如相关性和清晰性)上,与 Llama-3-70b-Chat 具有相似的加权 F1 分数,其加权 F1 分数的平均差异为 2.17%。这些模型在主观性较高的特征(如具体性和断言性)上表现明显更好,其加权 F1 分数的平均差异为 10.01%。此外,使用白宫新闻发布会和媒体简报的问答来测试 SubjECTive-QA 的泛化能力,使用我们针对每个特征的最佳模型获得了 65.97% 的平均加权 F1 分数,证明了其在金融领域之外的更广泛适用性。SubjECTive-QA 在 CC BY 4.0 许可下公开发布。
引用
@article{arxiv.2410.20651,
title = {SubjECTive-QA: Measuring Subjectivity in Earnings Call Transcripts' QA Through Six-Dimensional Feature Analysis},
author = {Huzaifa Pardawala and Siddhant Sukhani and Agam Shah and Veer Kejriwal and Abhishek Pillai and Rohan Bhasin and Andrew DiBiasio and Tarun Mandapati and Dhruv Adha and Sudheer Chava},
journal= {arXiv preprint arXiv:2410.20651},
year = {2025}
}
备注
Accepted at NeurIPS 2024