README.md
8.7 KB · 189 lines · markdown Raw
1 ---
2 license: other
3 library_name: audio.cpp
4 pipeline_tag: text-to-speech
5 tags:
6 - gguf
7 - audio.cpp
8 - quantized
9 - text-to-speech
10 - automatic-speech-recognition
11 - voice-conversion
12 - text-to-audio
13 - audio-to-audio
14 - source-separation
15 - speaker-diarization
16 - speech
17 base_model_relation: quantized
18 base_model:
19 - MiniMaxAI/MiniMax-H3
20 - ACE-Step/Ace-Step1.5
21 - ACE-Step/acestep-v15-base
22 - Aratako/Irodori-TTS-500M-v3
23 - Aratako/Irodori-TTS-600M-v3-VoiceDesign
24 - Aratako/Irodori-TTS-v4.1-Small
25 - Aratako/MioCodec-25Hz-44.1kHz-v2
26 - Aratako/MioTTS-1.7B
27 - Aratako/Semantic-DACVAE-Japanese-32dim
28 - Banafo/Kroko-ASR
29 - dots-studio/dots.tts-mf
30 - dots-studio/dots.tts-soar
31 - fishaudio/s2-pro
32 - FunAudioLLM/Fun-ASR-Nano-2512-hf
33 - HeartMuLa/HeartCodec-oss-20260123
34 - HeartMuLa/HeartMuLa-oss-3B
35 - HeartMuLa/HeartMuLaGen
36 - IndexTeam/IndexTTS-2
37 - IndexTeam/IndexTTS-2.5
38 - ASLP-lab/MeanVC2
39 - OpenBMB/VoxCPM2
40 - OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano
41 - OpenMOSS-Team/MOSS-Audio-Tokenizer-v2
42 - OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5
43 - OpenMOSS-Team/MOSS-TTS-Nano-100M
44 - Qwen/Qwen3-ASR-0.6B
45 - Qwen/Qwen3-ASR-1.7B-hf
46 - Qwen/Qwen3-ForcedAligner-0.6B
47 - Qwen/Qwen3-TTS-12Hz-0.6B-Base
48 - Qwen/Qwen3-TTS-12Hz-1.7B-Base
49 - Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
50 - Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign
51 - Qwen/Qwen3-TTS-Tokenizer-12Hz
52 - ResembleAI/chatterbox
53 - RMSnow/Vevo2
54 - bosonai/higgs-audio-v3-stt
55 - bosonai/higgs-audio-v3-tts-4b
56 - k2-fsa/OmniVoice
57 - kyutai/pocket-tts
58 - llm-jp/llm-jp-3-150m
59 - microsoft/VibeVoice-1.5B
60 - microsoft/VibeVoice-ASR
61 - mistralai/Voxtral-Mini-4B-Realtime-2602
62 - mlx-community/SeedVC-MLX
63 - mlx-community/mel-roformer-mlx
64 - mlx-community/supertonic-3-mlx
65 - mlx-community/wavlm-base-plus-mlx
66 - MuScriptor/muscriptor-small
67 - neuphonic/neutts-2e
68 - syvai/hviske-v5.3
69 - nvidia/diar_sortformer_4spk-v1
70 - nvidia/magpie_tts_multilingual_357m
71 - nvidia/nemotron-3.5-asr-streaming-0.6b
72 - nvidia/parakeet-tdt-0.6b-v3
73 - nvidia/personaplex-7b-v1
74 - owensong/Inflect-Micro-v2
75 - stabilityai/stable-audio-3-medium
76 - stabilityai/stable-audio-3-small-music
77 - stabilityai/stable-audio-3-small-sfx
78 ---
79
80 # audio.cpp GGUF Model Packages
81
82 This directory contains audio.cpp-native GGUF conversions of multiple speech models. These files are intended for use with [audio.cpp](https://github.com/0xShug0/audio.cpp).
83
84 If you enjoy the project, please star [audio.cpp on GitHub](https://github.com/0xShug0/audio.cpp) and this Hugging Face repository.
85
86 For conversion details, supported layouts, direct-file loading, sidecar embedding, and the latest compatibility notes, see the audio.cpp GGUF guide:
87
88 - https://github.com/0xShug0/audio.cpp/blob/main/docs/gguf.md
89
90 !!! Converted and quantized packages are checked with automated metrics, but perceived quality can still differ for human listeners. Please validate the exact package, backend, and route to confirm the output is acceptable for your use case.
91
92
93 ## Files
94
95 The table lists the GGUF packages currently provided by this repository.
96
97 | Directory | audio.cpp family | GGUF provided | Original model license |
98 |---|---|---|---|
99 | `ACE-Step1.5-GGUF` | `ace_step` | BF16 + Q8 | MIT |
100 | `AudioSR-GGUF` | `audiosr` | F32 | MIT |
101 | `BS-RoFormer-ep368-GGUF` | `bs_roformer` | Q8 | Apache-2.0 |
102 | `Breeze-TTS-2-GGUF` | `breeze_tts` | BF16 + Q8 + Q4 | BreezeBlue Research and Non-Commercial License |
103 | `Chatterbox-GGUF` | `chatterbox` | F16 + Q8 | MIT |
104 | `Chatterbox-Turbo-GGUF` | `chatterbox_turbo` | Q8 | MIT |
105 | `Citrinet-ASR-GGUF` | `citrinet_asr` | Q8 | CC-BY-4.0 |
106 | `Confucius4-TTS-GGUF` | `confucius4_tts` | original | Apache-2.0 |
107 | `ControlFoley-GGUF` | `controlfoley` | F32 | Apache-2.0 |
108 | `CosyVoice3-GGUF` | `cosyvoice3` | F32 + Q8 | Apache-2.0 |
109 | `DotTTS-Edit-GGUF` | `dots_tts` | BF16 + Q8 | Apache-2.0 |
110 | `DotTTS-MF-GGUF` | `dots_tts` | BF16 | Apache-2.0 |
111 | `DotTTS-SOAR-GGUF` | `dots_tts` | original + BF16 | Apache-2.0 |
112 | `DramaBox-GGUF` | `dramabox` | Q8 | LTX-2 Community License |
113 | `FireRedAudio-GGUF` | `firered_audio` | original + Q8 | Apache-2.0 |
114 | `FireRedTTS3-Base-GGUF` | `fireredtts3` | original + Q8 | Apache-2.0 |
115 | `FireRedTTS3-Instruct-GGUF` | `fireredtts3` | original + Q8 | Apache-2.0 |
116 | `Fish-Audio-S2-Pro-GGUF` | `fish_audio` | BF16 + Q8 | Fish Audio Research License |
117 | `Fun-ASR-Nano-2512-GGUF` | `fun_asr_nano` | F16 + Q8 | FunASR Model Open Source License Agreement v1.1 |
118 | `Granite-Speech-5.0-470M-TurboCTC-GGUF` | `granite5asr` | Q8 | Apache-2.0 |
119 | `HeartMuLa-GGUF` | `heartmula` | F16 + Q8 | Apache-2.0 |
120 | `HTDemucs-GGUF` | `htdemucs` | F16 + Q8 | MIT |
121 | `Higgs-Audio-v3-STT-GGUF` | `higgs_audio_stt` | F16 + Q8 | Apache-2.0 |
122 | `Higgs-Audio-v3-TTS-4B-GGUF` | `higgs_audio_tts` | BF16 + Q8 | Boson Higgs TTS 3 Research and Non-Commercial License |
123 | `Hviske-v5.3-GGUF` | `hviske_asr` | Q8 | CC-BY-NC-4.0 |
124 | `IndexTTS2-GGUF` | `index_tts2` | original + F16 + Q8 | bilibili Model Use License Agreement |
125 | `IndexTTS2.5-GGUF` | `index_tts2` | original + F16 + Q8 | bilibili Model Use License Agreement |
126 | `Inflect-Micro-v2-GGUF` | `inflect_v2` | original | Apache-2.0 |
127 | `Irodori-TTS-500M-v3-GGUF` | `irodori_tts` | F16 + Q8 | MIT |
128 | `Irodori-TTS-600M-v3-VoiceDesign-GGUF` | `irodori_tts` | F16 + Q8 | MIT |
129 | `Irodori-TTS-v4-Small-GGUF` | `irodori_tts` | F16 + Q8 | MIT |
130 | `Kokoro-82M-GGUF` | `kokoro_tts` | BF16 + Q8 | Apache-2.0 |
131 | `Kroko-ASR-GGUF` | `kroko_asr` | Q8 | CC-BY-SA community model license |
132 | `MMS-Forced-Aligner-GGUF` | `mms_forced_aligner` | F16 | CC-BY-NC-4.0 |
133 | `MOSS-TTS-Local-v1.5-GGUF` | `moss_tts_local` | BF16 + Q8 | Apache-2.0 |
134 | `MOSS-TTS-Nano-100M-GGUF` | `moss_tts_nano` | BF16 + Q8 | Apache-2.0 |
135 | `MOSS-VoiceGenerator-GGUF` | `moss_voicegen` | BF16 + F16 codec decode | Apache-2.0 |
136 | `MagpieTTS-Multilingual-357M-GGUF` | `magpie_tts` | original | NVIDIA Open Model License |
137 | `MeanVC2-GGUF` | `meanvc2` | F32 + Q4_K | Apache-2.0 |
138 | `Mel-Band-RoFormer-GGUF` | `mel_band_roformer` | F16 + Q8 | MIT |
139 | `MiDashengLM-Gen-GGUF` | `midashenglm_gen` | F32 + Q8 | Apache-2.0 |
140 | `MiniMax-H3-Q4-GGUF` | `minimax_h3` | Q4_K + INT8 DiT option | MiniMax-H3 Community License |
141 | `MioCodec-25Hz-44.1kHz-v2-GGUF` | `miocodec` | original + F16 + Q8 | MIT |
142 | `MioTTS-1.7B-GGUF` | `miotts` | original + BF16 + Q8 | Apache-2.0 |
143 | `Moonshine-Streaming-GGUF` | `moonshine_asr` | Q8 | MIT |
144 | `MuScriptor-Small-GGUF` | `muscriptor` | F32 | CC-BY-NC-4.0 |
145 | `Nemotron-3.5-ASR-Streaming-0.6B-GGUF` | `nemotron_asr` | F16 + Q8 | OpenMDW-1.1 |
146 | `NeuTTS-2E-GGUF` | `neutts` | original | Apache-2.0 |
147 | `OmniVoice-GGUF` | `omnivoice` | BF16 + F16 + Q8 | Apache-2.0 |
148 | `Parakeet-TDT-0.6B-v3-GGUF` | `parakeet_tdt` | F16 + Q8 | CC-BY-4.0 |
149 | `PersonaPlex-GGUF` | `personaplex` | Q4_K + Q8 | Apache-2.0 |
150 | `PocketTTS-GGUF` | `pocket_tts` | BF16 + Q8 | CC-BY-4.0 |
151 | `Qwen3-ASR-0.6B-GGUF` | `qwen3_asr` | F16 + Q8 | Apache-2.0 |
152 | `Qwen3-ASR-1.7B-GGUF` | `qwen3_asr` | F16 + Q8 | Apache-2.0 |
153 | `Qwen3-ForcedAligner-0.6B-GGUF` | `qwen3_forced_aligner` | F16 + Q8 | Apache-2.0 |
154 | `Qwen3-TTS-12Hz-0.6B-Base-GGUF` | `qwen3_tts` | BF16 + Q8 | Apache-2.0 |
155 | `Qwen3-TTS-12Hz-1.7B-Base-GGUF` | `qwen3_tts` | original + BF16 + Q8 | Apache-2.0 |
156 | `Qwen3-TTS-12Hz-1.7B-CustomVoice-GGUF` | `qwen3_tts` | BF16 + Q8 | Apache-2.0 |
157 | `Qwen3-TTS-12Hz-1.7B-VoiceDesign-GGUF` | `qwen3_tts` | BF16 + Q8 | Apache-2.0 |
158 | `RVC-GGUF` | `rvc` | F16 | MIT |
159 | `SeedVC-MLX-GGUF` | `seed_vc` | original + F16 + Q8 | GPL-3.0 |
160 | `Sortformer-Diar-4spk-v1-GGUF` | `sortformer_diar` | F16 + Q8 | CC-BY-NC-4.0 |
161 | `Stable-Audio-3-Medium-GGUF` | `stable_audio` | F16 + Q8 | Stability AI Community License |
162 | `Stable-Audio-3-Small-Music-GGUF` | `stable_audio` | F16 + Q8 | Stability AI Community License |
163 | `Stable-Audio-3-Small-SFX-GGUF` | `stable_audio` | F16 + Q8 | Stability AI Community License |
164 | `Supertonic-3-GGUF` | `supertonic` | original + F16 + Q8 | BigScience Open RAIL-M |
165 | `Vevo2-GGUF` | `vevo2` | original + F16 + Q8 | CC-BY-NC-ND-4.0 |
166 | `VibeVoice-1.5B-GGUF` | `vibevoice` | BF16 + Q8 + Q4 | MIT |
167 | `VibeVoice-ASR-GGUF` | `vibevoice_asr` | F16 + Q8 | MIT |
168 | `VoxCPM1-GGUF` | `voxcpm1` | Q8 + F16 AudioVAE | Apache-2.0 |
169 | `VoxCPM2-GGUF` | `voxcpm2` | original + BF16 + Q8 | Apache-2.0 |
170 | `Voxtral-Mini-4B-Realtime-2602-GGUF` | `voxtral_realtime` | BF16 + Q8 + Q4_K | Apache-2.0 |
171
172 ## Usage
173
174 Pass a GGUF file directly as `--model`:
175
176 ```bash
177 audiocpp_cli --task tts --family supertonic --model Supertonic-3-GGUF/supertonic-3-orig.gguf --backend cuda --language en --text "Hello." --voice-id M1 --out out.wav
178 ```
179
180 For ASR:
181
182 ```bash
183 audiocpp_cli --task asr --family qwen3_asr --model Qwen3-ASR-0.6B-GGUF/qwen3-asr-0.6b-f16.gguf --backend cuda --audio speech.wav --text "" --text-out transcript.txt
184 ```
185
186 ## License
187
188 Each GGUF file is a converted form of its original model. Use and redistribution are governed by the corresponding original model license listed above. Please review the original model card and license terms before using or redistributing any converted weights.
189