基于LSTM-CBAM的音视频同步人脸视频生成

洪学敏; 张海翔

首页> 中文期刊>智能计算机与应用 >基于LSTM-CBAM的音视频同步人脸视频生成

基于LSTM-CBAM的音视频同步人脸视频生成

开具论文收录证明 >>

期刊封面封底目录下载 >>

页面导航

摘要
著录项
相似文献
相关主题

摘要

语音驱动的人脸视频生成是指通过视觉与听觉双模态的输入来生成唇音同步的高自然度人脸视频。人脸视频生成任务的主要挑战是如何在保证人脸面部真实性的同时,生成语音同步且连贯的人脸视频。传统方法仅将其考虑为多个单帧的视频生成,而不考虑视频帧间的时序关系,从而导致生成的视频存在不连贯性,容易出现像素抖动问题。本文提出了基于LSTM-CBAM的音视频同步生成模型来生成唇音同步的人脸视频,通过LSTM模块处理音频数据,可以对音频数据进行更好地特征编码,通过CBAM模块来推断网络中的注意力映射,可以实现对音频信息与人脸口型信息的特征细化,从而生成音频与人物口型同步的视频。实验结果表明,本文生成的人脸视频连续自然,指标较优。

著录项

来源
《智能计算机与应用》|2023年第5期|151-155|共5页
作者
洪学敏; 张海翔;
展开▼
作者单位

浙江理工大学信息学院;

展开▼
原文格式 PDF
正文语种 chi
中图分类信息处理（信息加工）;人工神经网络与计算;
关键词
视频生成; 语音驱动; 生成式对抗网络;
入库时间 2023-06-26 21:14:32

相似文献

中文文献
外文文献
专利

1. 基于数字视频的水印技术解决音视频同步的探讨 [J] . 杨光明 . 现代电视技术 . 2008,第002期
2. 基于数字视频的水印技术解决音视频同步的探讨 [J] . 杨光明 . 影视制作 . 2007,第011期
3. 基于关键点表示的语音驱动说话人脸视频生成 [J] . 年福东 ,王文涛 ,王妍 . 模式识别与人工智能 . 2021,第6期
4. 基于数字编码的多媒体信息音视频同步传输方法研究 [J] . 李慧玲 . 数字通信世界 . 2019,第003期
5. 基于DSP+ARM的音视频同步压缩存储实时传输系统设计 [J] . 闫亚玲 ,李博 ,孟祥飞 . 实验室研究与探索 . 2019,第1期
6. 一种基于对抗生成网络的人脸生成方案 [C] . MA Yue ,马悦 ,CUI Yu . 中国计算机用户协会网络应用分会2020年第二十四届网络新技术与应用年会 . 2020
7. 基于语音驱动的人脸视频生成 [A] . 洪学敏 . 2022

基于LSTM-CBAM的音视频同步人脸视频生成

摘要

著录项

相似文献

相关主题

期刊订阅