从文本中抽取受害者数量
计算与语言
2023-02-27 v1 人工智能
机器学习
摘要
人道主义领域的决策者在危机事件中依赖及时且准确的信息。了解地震中有多少平民受伤对于合理分配援助至关重要。此类受害者数量的信息往往仅存在于报纸和其他报告的全文事件描述中。从文本中抽取数字具有挑战性:数字格式多样且可能需要数值推理,这使得纯基于字符串匹配的方法不够充分。因此,除死亡人数外,受伤、流离失所或受虐待受害者的细粒度数量常常未被抽取而保持未知。我们将受害者数量抽取视为具有回归或分类目标的问题回答(QA)任务。我们比较了正则表达式、依存句法分析、基于语义角色标注的方法以及先进的文本到文本模型。除模型准确率外,我们还分析了对于这一敏感任务至关重要的抽取可靠性和鲁棒性。特别地,我们讨论了模型校准并研究了少样本和分布外性能。最终,我们就针对不同需求和数据集域应选择何种模型给出了综合建议。我们的工作是首批将关注数值能力的大型语言模型应用于具有积极影响的真实世界用例的工作之一。
引用
@article{arxiv.2302.12367,
title = {Extracting Victim Counts from Text},
author = {Mian Zhong and Shehzaad Dhuliawala and Niklas Stoehr},
journal= {arXiv preprint arXiv:2302.12367},
year = {2023}
}
备注
Long paper accepted at EACL 2023 main conference