中文

双目双视角,一切为医学对话摘要:面向多模态多任务知识驱动的医学对话摘要生成

计算与语言 2024-07-23 v1

摘要

我们通常会以两个阶段对多方对话进行摘要:首先以同质单元进行分块,然后对分块进行摘要。因此,我们假设同质说话人分块与整体摘要任务之间存在关联。在本工作中,我们探讨了一种多层面方法,同时生成医疗关切、医生印象以及整体视图的摘要。我们引入一种面向医学对话摘要生成的多模态、多任务、知识驱动模型(MMK-Summation),通过带门控机制的适配器微调实现多模态信息的集成。该模型接受对话作为输入,基于上下文提取相关的外部知识,将知识与对话中的视觉线索融合到文本内容中,最终生成涵盖医疗关切、医生印象和综合概览的简洁摘要。该模型在所有评估指标上(包括人工评估)均超越了多个基线方法和传统摘要模型,坚实地证明了知识引导的多任务、多模态医学对话摘要的有效性。代码已公开于 https://github.com/NLP-RL/MMK-Summation。

关键词

引用

@article{arxiv.2407.15237,
  title  = {Two eyes, Two views, and finally, One summary! Towards Multi-modal Multi-tasking Knowledge-Infused Medical Dialogue Summarization},
  author = {Anisha Saha and Abhisek Tiwari and Sai Ruthvik and Sriparna Saha},
  journal= {arXiv preprint arXiv:2407.15237},
  year   = {2024}
}