← all repositories

jishengpeng/WavTokenizer

A discrete audio codec that compresses speech, music, and audio into 40-75 tokens per second for use in language model pipelines.

WavTokenizer
Not currently ranked — collecting fresh signals.
star history

WavTokenizer is a state-of-the-art discrete acoustic codec model that tokenizes audio into 40 or 75 tokens per second. It encodes speech, music, and general audio into discrete semantic tokens suitable for audio language modeling tasks similar to GPT-4o. The model supports reconstruction of audio from discrete tokens and is intended as a front-end component for generative audio models and multimodal LLM systems.

Frequently asked

What is jishengpeng/WavTokenizer?
A discrete audio codec that compresses speech, music, and audio into 40-75 tokens per second for use in language model pipelines.
Is WavTokenizer open source?
Yes — jishengpeng/WavTokenizer is open source, released under the MIT license.
What language is WavTokenizer written in?
jishengpeng/WavTokenizer is primarily written in Python.
How popular is WavTokenizer?
jishengpeng/WavTokenizer has 1.3k stars on GitHub.
Where can I find WavTokenizer?
jishengpeng/WavTokenizer is on GitHub at https://github.com/jishengpeng/WavTokenizer.

heatdrop uses Google Analytics to see which pages get read — nothing else. Your call. How we handle data.