OpenDebateEvidence:大规模论证挖掘与摘要数据集
计算与语言
2024-11-01 v3 人工智能
机器学习
摘要
我们介绍 OpenDebateEvidence,这是一个来自美国竞技辩论社区的论证挖掘与摘要综合数据集。该数据集包含超过 350 万篇带有丰富元数据的文档,堪称最广泛的辩论证据集合。OpenDebateEvidence 捕捉了高中和大学辩论中论证的复杂性,为训练和评估提供了宝贵资源。我们的大量实验表明,对 state-of-the-art 大型语言模型进行微调,可在各种方法、模型和数据集上实现论证性 abstractive 摘要。通过提供这一全面资源,我们旨在推动计算论证,支持辩手、教育者和研究者的实际应用。OpenDebateEvidence 已公开提供,以支持进一步的研究与创新。访问链接:https://huggingface.co/datasets/Yusuf5/OpenCaselist
引用
@article{arxiv.2406.14657,
title = {OpenDebateEvidence: A Massive-Scale Argument Mining and Summarization Dataset},
author = {Allen Roush and Yusuf Shabazz and Arvind Balaji and Peter Zhang and Stefano Mezza and Markus Zhang and Sanjay Basu and Sriram Vishwanath and Mehdi Fatemi and Ravid Shwartz-Ziv},
journal= {arXiv preprint arXiv:2406.14657},
year = {2024}
}
备注
Published to the 38th Conference on Neural Information Processing Systems (NeurIPS 2024) Track on Datasets and Benchmarks