国内刊号:43-1258/TP
国际刊号:1007-130X
发布日期:
作者:尤丛丛, 高盛祥, 余正涛, 毛存礼, 潘润海,
单位:1.昆明理工大学信息工程与自动化学院,云南 昆明 650500;2.昆明理工大学云南省人工智能重点实验室,云南 昆明 650500)
关键词:汉越,数据增强,同义词替换,神经机器翻译,
基金:国家重点研发计划(2019QY1801,2019QY1802,2019QY1800);国家自然科学基金(61761026,61972186,61732005,61672271,61762056);云南省高新技术产业专项(201606);云南省自然科学基金(2018FB104);昆明理工大学省级人培项目(KKSY201703005)
汉越平行语料库的资源稀缺,很大程度上影响了汉越机器翻译效果。数据增强是提升汉越机器翻译的有效途径,基于双语词典的词汇替换数据增强是当前较为流行的方法。由于汉语-越南语属于低资源语言对,双语词典难以获得,而通过单语词向量获取低频词的同义词较为容易。因此,提出一种基于低频词的同义词替换的数据增强方法。该方法利用小规模的平行语料,首先通过对单语词向量的学习,获得一端语言低频词的同义词列表;然后对低频词进行同义词替换,再利用语言模型对替换后的句子进行筛选;最后将筛选后的句子与另一端语言中的句子进行匹配,获得扩展的平行语料。汉越翻译对比实验结果表明,提出的方法取得了很好的效果,扩展后的方法比基准和回译方法在BLEU值上分别提高了1.8和1.1。
来源:2021年第8期
《计算机工程与科学》期刊编辑部