Video Frame Synthesis using Deep Voxel Flow 论文笔记

时间：2017-02-13 13:31:46 阅读：1352 评论：0 收藏：0 [点我收藏+]

arXiv

　　摘要：本文解决了模拟新的视频帧的问题，要么是现有视频帧之间的插值，要么是紧跟着他们的探索。这个问题是非常具有挑战性的，因为，视频的外观和运动是非常复杂的。传统 optical-flow-based solutions 当 flow estimation 失败的时候，就变得非常困难；而最新的基于神经网络的方法直接预测像素值，经常产生模糊的结果。

　　于是，在此motivation的基础上，作者提出了结合这两种方法的思路，通过训练一个神经网络，来学习去合成视频帧，通过 flowing pixel values from existing ones, 我们称之为：deep voxel flow. 所提出的方法不需要人类监督，任何video都可以用于训练，通过丢掉，并且预测现有的frames。这种方法是非常有效的，可以用于任何的分辨率。实验结果还是不错的。

　　引言：本文所涉及到的两个重要的部分，一个是 video interporation；一个是 video extrapolation。

　　传统的方法解决上述问题，就是依赖于帧与帧之间的 optical flow，然后进行 optical flow vectors 之间的【插值】或者【预测】。这种方法称为：“optical-flow-complete”；当光流准确的时候，这种方法是非常有效的，但是当不准确的时候，就会产生额外的错误信息。一种基于产生式 CNN 的方法，直接产生 RGB 像素值。但是这种方法经常会产生模糊的情况，并非像光流一样有效。

　　本文的目标是结合这两种方法的优势。作者有两个方面的观察：

　　1. 大部分像素块都是近邻图像的直接copy，而直接copy pixels 比模拟产生他们，要简单的多。

　　2. 端到端训练的神经网络是一个非常有效的工具。对于 video interpolation 和 extrapolation 来说，更是如此，因为训练可以是无限的；任何video都可以用于训练一个无监督的神经网络。

　　所以，我们就可以利用现有的video进行无监督的学习。我们扔掉 frames，然后利用损失函数来衡量产生的像素值和 gt 像素值之间的差距。但是，像 optical-flow approaches 一样，我们的网络通过从附近的 frames 插值 pixel values。这个网络包括 a voxel flow layer ------ a per-pixel, 3D optical flow vector across space and time in the input video. 所以，对于 video interpolation，最终输出的像素值，可以是前一帧和后一帧混合的像素值。

　　The Proposed Methods :

　　本文提出一种 Deep Voxel Flow (DVF) 算法 ------ an end-to-end fully differentiable network for video frame synthesis.

Video Frame Synthesis using Deep Voxel Flow 论文笔记

原文：http://www.cnblogs.com/wangxiaocvpr/p/6393268.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年09月23日 (328)
2021年09月24日 (313)
2021年09月17日 (191)
2021年09月15日 (369)
2021年09月16日 (411)
2021年09月13日 (439)
2021年09月11日 (398)
2021年09月12日 (393)
2021年09月10日 (160)
2021年09月08日 (222)