Datasets:
Corpus anglais multi-locuteurs (en)
15,540 extraits | 1036 voix REELLES | 26.1 h | FLAC mono 24 kHz
Tire de LibriTTS-R (train.clean.100, train.clean.360), corpus de lecture restaure concu pour le TTS.
C'est le seul corpus du projet bati sur des locuteurs humains reels et non sur des timbres synthetiques : le francais, le mauricien, le ngiemboon et le malgache passent tous par un clonage, faute de voix disponibles.
Structure
| colonne | exemple |
|---|---|
id |
en_3185_train.clean._00117 |
speaker_id |
429 — index, 0 a 1035 |
speaker_name |
libritts_3185 |
text |
When the king heard that, he warned all the court not to lau… |
text_phonemized |
vide — voir plus bas |
audio |
FLAC mono 24 kHz, octets embarques |
duration |
3.60 secondes |
from datasets import load_dataset
d = load_dataset("mimba/multivoice-en", split="train")
Comment il a ete trie
Sur 117,398 enonces disponibles :
- duree entre 1.5 et 15.0 s ;
- sifflement mesure avant selection : part d'energie 6,5-13 kHz par trame de ~23 ms, p90 <= 0.5 ;
- 15 clips par voix au maximum, tires AU HASARD parmi ceux qui passent — et non les moins sifflants, ce qui aurait selectionne les enonces les plus courts et les plus sourds de chaque locuteur ;
- au moins 15 clips par voix retenue.
Le plafond est bas a dessein : LibriTTS-R offrirait quatre fois plus de clips, mais l'anglais ecraserait alors les autres langues d'un entrainement multilingue. A 15 clips par voix, toute la diversite de locuteurs est conservee pour un volume comparable aux autres corpus du projet.
Phonemes
text_phonemized est vide : la phonemisation depend d'une decision non
tranchee sur le vocabulaire de BlueTTS — notamment l'ajout de marqueurs de
langue, sans lesquels le modele confond les prosodies du francais et des creoles
a base francaise. Le texte brut est fourni, deja normalise par LibriTTS-R.
- Downloads last month
- 85