国内刊号:43-1258/TP
国际刊号:1007-130X
发布日期:
作者:蔡钺, 游进国, 丁家满
单位:(1.昆明理工大学信息工程与自动化学院,云南 昆明 650500;2.云南省计算机技术应用重点实验室,云南 昆明 650500)
关键词:对话生成;近端策略优化;强化学习;对抗生成网络;序列到序列模型 ,
基金:国家自然科学基金(61462050,61562054);云南省自然科学基金(KKSY201603016)
对话生成是自然语言处理的重点研究方向,对抗生成网络GAN最近在对话生成领域得到了较好的应用。为了进一步改善对话生成的质量,并且解决GAN训练过程中判别模型返回奖励重复利用率低从而导致模型训练效率低的问题,提出一种基于近端策略优化PPO的对话生成算法PPO_GAN。该算法通过GAN模型生成对话,通过判别模型区分生成的对话与真实的对话。并采用近端策略优化的方法训练GAN,能处理GAN在对话生成时导致的反向传播不可微分的情况,在保证生成模型单调非减训练的同时,通过限制生成模型迭代的梯度使判别模型得到的奖励可以重复利用。实验结果表明,对比于极大似然估计与Adver-REGS等对话生成算法,PPO_GAN算法提高了对话训练的效率并且改善了对话生成的质量。
来源:2020年第9期
《计算机工程与科学》期刊编辑部