MIT脑洞研究：只听6秒语音，就知道你长什么样( 三 )

2019-05-25

为此，研究人员提取了几百万个YouTube视频，通过训练，让深度神经网络学习声音和面部的相关性，找到说话的人一些基本特征，比如年龄、性别、种族等，并还原出相貌。

而且在这个过程中，不需要人类标记视频，由模型自我监督学习。这就是文章中所说的Speech2Face模型。

将电话另一端通过卡通人物的方式显示在你的手机上，可能是Speech2Face未来的一种实际应用。

模型结构

Speech2Face模型是如何还原人脸的，请看下图：

给这个网络输入一个复杂的声谱图，它将会输出4096-D面部特征，然后使用预训练的面部解码器将其还原成面部的标准图像。

训练模块在图中用橙色部分标记。在训练过程中，Speech2Face模型不会直接用人脸图像与原始图像进行对比，而是与原始图像的4096-D面部特征对比，省略了恢复面部图像的步骤。

推荐阅读

上一篇：甘比：香港地价贵瞄准英国称入股恒大胜过自行北上

下一篇：什么是美好生活？拥有有趣灵魂的创意人这样说