中文

面向文本简化的自动反馈循环:保护生成式AI免受信息丢失

计算与语言 2025-09-03 v1 人工智能

摘要

理解健康信息对于实现和维持健康生活至关重要。我们聚焦于简化健康信息以便更好地理解。随着生成式AI的可用性,简化过程变得高效且质量合理,但这些算法会删除可能对理解至关重要的信息。在本研究中,我们比较了生成式AI用于检测简化文本中缺失信息的方法,评估其重要性,并通过添加缺失信息来修复文本。我们收集了50篇健康信息文本,并使用gpt-4-0613对其进行简化。我们比较了五种识别缺失元素的方法,并通过插入缺失元素来重新生成文本。这些五种方法涉及以各种方式添加缺失实体和缺失单词:1)添加所有缺失实体,2)添加所有缺失单词,3)添加按gpt-4-0613排序的前3个实体,以及4、5)作为比较控制,添加随机选择的实体。我们使用余弦相似度和ROUGE分数来评估原始文本、简化文本和重建简化文本之间的语义相似度和内容重叠。我们对摘要和完整文本都进行了此类评估。总体而言,我们发现添加缺失实体会改善文本。添加所有缺失实体的结果在文本重建方面优于添加排名靠前的实体或单词,或随机单词。当前工具可以识别这些实体,但在对其进行排序方面并不实用。

关键词

引用

@article{arxiv.2505.16172,
  title  = {Automated Feedback Loops to Protect Text Simplification with Generative AI from Information Loss},
  author = {Abhay Kumara Sri Krishna Nandiraju and Gondy Leroy and David Kauchak and Arif Ahmed},
  journal= {arXiv preprint arXiv:2505.16172},
  year   = {2025}
}