国内刊号:43-1258/TP
国际刊号:1007-130X
发布日期:
作者:吴志豪, 张德军, 吴亦奇, 陈壹林
单位:1.中国地质大学(武汉)计算机学院,湖北 武汉 430078;2.智能机器人湖北省重点实验室(武汉工程大学),湖北 武汉 430205
关键词:三维视线估计,表观,多层感知机,实时性,
基金:国家自然科学基金(61802355);智能机器人湖北省重点实验室开放基金(HBIR 202105)
随着卷积神经网络(CNN)在计算机视觉领域的广泛应用,以及大量三维视线数据集的公开,基于表观和深度学习相结合的三维视线估计研究受到越来越多的关注。由于CNN结构复杂,这类方法在实时性要求较高的应用场景中还有待进一步改进。近来兴起的研究表明,网络结构更为简单的多层感知机(MLP)模型能够取得与当前最佳CNN、Transformer模型相当的性能。受此启发,提出了一种基于MLP的高效高精度三维视线估计方法,利用MLP模型对双眼、人脸图像提取特征,之后融合推导出三维视线。实验结果表明,对MPIIFaceGaze数据集和EyeDiap数据集中包含的31位不同相貌的受试者,使用提出的方法UM-Net进行视线估计,视线估计精度比肩基于CNN的,并且在视线估计速度上具有明显优势,在实时性要求较高的领域也有较好的应用前景。
来源:2023年第11期
《计算机工程与科学》期刊编辑部