AGGA:面向生成式人工智能与大语言模型的学术指南数据集
计算与语言
2025-03-19 v3 计算机与社会
摘要
本研究介绍 AGGA,这是一个包含 80 项学术指南的数据集,用于在学术环境中使用生成式人工智能 (GAI) 和大语言模型 (LLM)。该数据集从官方大学网站中仔细收集,包含 188,674 个单词,为常见的需求工程任务(如模型综合、抽象识别和文档结构评估)提供了宝贵资源。此外,AGGA 可进一步标注,用于各种任务,包括歧义检测、需求分类和识别等价需求。我们的方法论严谨,确保进行彻底检查,所选大学代表全球多元化机构,包括六大洲顶尖大学。数据集捕捉来自人文科学、技术科学以及公共和私营机构的视角,为理解 GAI 和 LLM 在学术界的集成提供了广泛的视角。
引用
@article{arxiv.2501.02063,
title = {AGGA: A Dataset of Academic Guidelines for Generative AI and Large Language Models},
author = {Junfeng Jiao and Saleh Afroogh and Kevin Chen and David Atkinson and Amit Dhurandhar},
journal= {arXiv preprint arXiv:2501.02063},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2406.18842, arXiv:2501.00959