← all repositories

researchmm/MM-Diffusion

A PyTorch implementation of a diffusion model that generates aligned audio-video pairs using a sequential multi-modal U-Net with separate audio and video subnets.

454 stars Python Image · Video · Audio
MM-Diffusion
Not currently ranked — collecting fresh signals.
star history

This repository implements the MM-Diffusion framework for joint audio and video generation, accepted at CVPR 2023. It uses a sequential multi-modal U-Net architecture where two subnets learn to generate aligned audio-video pairs from Gaussian noise. The model supports conditional generation and was trained on datasets including landscape, AIST++, and AudioSet.

Frequently asked

What is researchmm/MM-Diffusion?
A PyTorch implementation of a diffusion model that generates aligned audio-video pairs using a sequential multi-modal U-Net with separate audio and video subnets.
Is MM-Diffusion open source?
Yes — researchmm/MM-Diffusion is open source, released under the MIT license.
What language is MM-Diffusion written in?
researchmm/MM-Diffusion is primarily written in Python.
How popular is MM-Diffusion?
researchmm/MM-Diffusion has 454 stars on GitHub.
Where can I find MM-Diffusion?
researchmm/MM-Diffusion is on GitHub at https://github.com/researchmm/MM-Diffusion.

heatdrop uses Google Analytics to see which pages get read — nothing else. Your call. How we handle data.