fishaudio/fish-diffusion
A PyTorch-based framework for training Text-to-Speech, Singing Voice Synthesis, and Singing Voice Conversion models using diffusion.

Not currently ranked — collecting fresh signals.
star history
Fish Diffusion is a training framework for audio generation tasks including Text-to-Speech (TTS), Singing Voice Synthesis (SVS), and Singing Voice Conversion (SVC). It leverages diffusion models and PyTorch to generate high-quality audio, featuring support for HiFiSinger models and integration with HuggingFace Spaces for model hosting.
Frequently asked
- What is fishaudio/fish-diffusion?
- A PyTorch-based framework for training Text-to-Speech, Singing Voice Synthesis, and Singing Voice Conversion models using diffusion.
- Is fish-diffusion open source?
- Yes — fishaudio/fish-diffusion is open source, released under the MIT license.
- What language is fish-diffusion written in?
- fishaudio/fish-diffusion is primarily written in Python.
- How popular is fish-diffusion?
- fishaudio/fish-diffusion has 747 stars on GitHub.
- Where can I find fish-diffusion?
- fishaudio/fish-diffusion is on GitHub at https://github.com/fishaudio/fish-diffusion.