iTAG:具有精确因果图标注的自然文本生成逆向设计
计算与语言
2026-04-09 v1
摘要
从文本中进行因果发现的一个基本障碍是缺乏带有因果标注的文本数据作为真实标签,原因是标注成本高昂。这激发了生成带有因果图标注的文本这一重要任务。早期的基于模板生成方法以牺牲文本自然性为代价换取了高因果图标注准确性。近期依赖大语言模型(LLM)的方法通过 LLM 直接从目标图生成自然文本,但不能保证因果图标注的准确性。因此,我们提出了 iTAG,它在现有依赖 LLM 的方法中将因果图转换为文本之前,对节点执行真实世界概念分配。iTAG 将这一过程框定为以因果图为目标的逆向问题,通过思维链(CoT)推理迭代地审视和优化概念选择,使概念之间诱导出的关系尽可能与因果图描述的目标因果关系保持一致。iTAG 在广泛测试中展示了极高的标注准确性和自然性,并且使用生成数据测试基于文本的因果发现算法的结果显示出与真实数据的高度统计相关性。这表明 iTAG 生成的数据可以作为基于文本的因果发现算法可扩展基准测试的实用替代品。
引用
@article{arxiv.2604.06902,
title = {iTAG: Inverse Design for Natural Text Generation with Accurate Causal Graph Annotations},
author = {Wenshuo Wang and Boyu Cao and Nan Zhuang and Wei Li},
journal= {arXiv preprint arXiv:2604.06902},
year = {2026}
}
备注
Accepted at ACL 2026