国内刊号:43-1258/TP
国际刊号:1007-130X
发布日期:
作者:杜连成, 郭军军, 叶俊杰, 余正涛,
单位:(1.昆明理工大学信息工程与自动化学院,云南 昆明 650504;2.云南省人工智能重点实验室,云南 昆明 650500)
关键词:多模态神经机器翻译,双视觉特征交互,图-文跨模态自适应融合,
基金:国家重点研发计划(2020-AAA0107904);国家自然科学基金(61866020);云南省科技厅自然科学基金(202301AT070444);云南省重大科技专项(202103AA080015)
多模态神经机器翻译的目标是通过引入其他模态信息来提升纯文本神经机器翻译的质量。图像中包含了实体对象的关系、属性以及空间位置关系等多种语义信息。然而,目前存在的大多数融合方法仅考虑图像的部分视觉信息,忽略了对视觉模态内部关系的探索,导致视觉信息的利用率较低,无法充分利用图像所包含的全部语义信息。因此,提出了一种双级交互式自适应融合的多模态神经机器翻译方法,该方法考虑了图像不同方面的属性特征,以充分利用图像的视觉信息。实验结果显示,该方法能够有效地利用图像所具有的视觉信息,并且在Multi30K数据集的英语→德语(EN→DE)和英语→法语(EN→FR)2种翻译任务的测试上的效果显著优于当前大多数的效果最优(SOTA)多模态神经机器翻译方法的结果,十分具有竞争力。
来源:2024年第11期
《计算机工程与科学》期刊编辑部