Chain-of-Talkers (CoTalk):密集图像描述的快速人工标注
材料科学
2025-05-29 v1
摘要
尽管密集标注的图像描述显著促进了鲁棒的视觉-语言对齐学习,但系统性优化人工标注工作的方法仍未被充分探索。我们引入了 Chain-of-Talkers (CoTalk),这是一种人在回路(AI-in-the-loop)的方法论,旨在固定预算约束(例如总人工标注时间)下最大化已标注样本的数量并提高其全面性。该框架建立在两个关键见解之上。首先,与传统的并行标注相比,顺序标注减少了冗余工作量,因为后续标注者只需标注“残差”——即先前标注未覆盖的缺失视觉信息。其次,人类通过阅读处理文本输入的速度更快,同时通过说话以更高的吞吐量输出标注;因此,多模态界面实现了优化的效率。我们从两个方面评估了我们的框架:内部评估通过将详细描述解析为对象-属性树并分析其有效连接来评估语义单元的全面性;外部评估则衡量已标注描述在促进视觉-语言对齐中的实际用途。八名参与者的实验表明,与并行方法相比,我们的 Chain-of-Talkers (CoTalk) 提高了标注速度(0.42 vs. 0.30 units/sec)和检索性能(41.13% vs. 40.52%)。
引用
@article{arxiv.2505.22628,
title = {Lattice Compatibility and Energy Barriers in Intercalation Compounds},
author = {Delin Zhang and Ananya Renuka Balakrishna},
journal= {arXiv preprint arXiv:2505.22628},
year = {2025}
}
备注
37 pages, 15 figures