IGGA:面向生成式 AI 的行业指南与政策声明数据集
计算机与社会
2025-03-19 v3
摘要
本文介绍了 IGGA,这是一个包含 160 份行业指南和政策声明的数据集,用于规范生成式 AI(GAI)和大型语言模型(LLM)在工业和工作场所环境中的使用,这些数据收集自公司官方网站和可信的新闻来源。该数据集包含 104,565 个词,作为需求工程中常用的自然语言处理任务的宝贵资源,例如模型合成、抽象识别和文档结构评估。此外,IGGA 可以进一步被标注以作为各种任务的基准,包括歧义检测、需求分类和等价需求识别。我们方法上的严谨性确保了全面的审查,挑选了代表六大洲不同全球机构的知名且具影响力的公司。该数据集涵盖了十四个行业部门的观点,包括技术、金融以及公共和私营机构,为 GAI 和 LLM 在工业中的整合提供了广泛的见解。
引用
@article{arxiv.2501.00959,
title = {IGGA: A Dataset of Industrial Guidelines and Policy Statements for Generative AIs},
author = {Junfeng Jiao and Saleh Afroogh and Kevin Chen and David Atkinson and Amit Dhurandhar},
journal= {arXiv preprint arXiv:2501.00959},
year = {2025}
}