评估自动生成缝纫指令的时空一致性
计算与语言
2025-09-30 v1
摘要
在本文中,我们提出了一种新颖的、基于树的自动评估指标,用于 LLM 生成的分步组装指令,该指标比 BLEU 和 BERT 相似度分数等传统指标更准确地反映构建的时空方面。我们将提出的指标应用于缝纫指令领域,并表明我们的指标与人工标注的错误计数以及人类质量评分具有更好的相关性,证明了我们的指标在评估缝纫指令时空合理性方面的优越性。进一步的实验表明,对于专门构造以混淆依赖文本相似性指标的人工构造反事实样本,我们的指标比传统方法更具鲁棒性。
引用
@article{arxiv.2509.24792,
title = {Evaluating Spatiotemporal Consistency in Automatically Generated Sewing Instructions},
author = {Luisa Geiger and Mareike Hartmann and Michael Sullivan and Alexander Koller},
journal= {arXiv preprint arXiv:2509.24792},
year = {2025}
}
备注
18 pages, 14 figures; to be published in EMNLP 2025 proceedings