通向结构化数据与自然语言双射的路径及 LLM 标注的作用
计算与语言
2024-01-17 v1
摘要
本工作发现了有限的证据支持这样一种理论:使用多个任务结合 sequence-to-sequence transformer 语言模型可以提升某些指标上的性能。具体而言,多任务通用模型 t5-small 的表现优于专用模型 t5-small,其 分数从 提升至 ,这可能指向潜在的跨任务知识泛化。这进一步表明,即使在相同的网络中,以不同方式“重用”相同数据也可能在某些指标上带来更高的性能。然而,仅逆任务本身可能只是一种优化策略,因为在本文所探索的模型规模下,它并未带来显著的总体改善。此外,加入约 4500 条 LLM 标注记录(与 12800 条 WebNLG 训练记录交织)与未加入该合成数据的相同 t5-small 模型相比,并未显著改变自动指标的性能。这可能是由于模型规模导致的学习能力瓶颈,而观察到的性能下降可能是由于语料库中的分布差异所致。需要未来使用更大模型或进行人工评估的研究,以更充分地解释促成这些任务性能提升的机制。
引用
@article{arxiv.2401.07190,
title = {Inroads to a Structured Data Natural Language Bijection and the role of LLM annotation},
author = {Blake Vente},
journal= {arXiv preprint arXiv:2401.07190},
year = {2024}
}
备注
Graduate Coursework