1 article
Meituan introduced LongCat-AudioDiT, a diffusion-based TTS model operating in waveform latent space. The system improves voice cloning and multilingual audio generation by eliminating intermediate representations like mel-spectrograms.
We use cookies to improve your experience on our site and to show you relevant advertising. To find our more, read our privacy policy and cookie policy