User Tools

Site Tools


informatica:inteligencia_artificial:tts

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revisionPrevious revision
Next revision
Previous revision
informatica:inteligencia_artificial:tts [2026/06/26 12:42] – [Entrenar COQUI TTS con XTTS] joseinformatica:inteligencia_artificial:tts [2026/07/04 00:03] (current) jose
Line 1: Line 1:
 +====== Herramientas ======
 +Para grabar voz mimic:\\
 +https://github.com/MycroftAI/mimic-recording-studio/
 +
 +Este es mas moderno:
 +https://github.com/rhasspy/piper-recording-studio/
 +
 +  docker run -it -p 8000:8000 -v "$PWD/output:/app/output" rhasspy/piper-recording-studio
 +
 +Videos Youtube:\\
 +https://www.youtube.com/@ThorstenMueller/
 +
 +
 ====== Español en Mac ====== ====== Español en Mac ======
   git clone https://github.com/jpgallegoar/Spanish-F5.git   git clone https://github.com/jpgallegoar/Spanish-F5.git
Line 131: Line 144:
   python generar_voz.py entrada.txt salida.mp3   python generar_voz.py entrada.txt salida.mp3
      
 +
 +====== Piper TTS ======
 +El proyecto en el 2026 se ha movido a:\\
 +https://github.com/OHF-voice/piper1-gpl
 +
 +Seguimos README.md
 +  git clone https://github.com/OHF-voice/piper1-gpl
 +  cd piper1-gpl
 +  python -m venv venv
 +  pip install piper-tts
 +Listamos voces
 +  python3 -m piper.download_voices
 +Descargamos castellano
 +  mkdir ES && cd ES
 +  python3 -m piper.download_voices es_ES-sharvard-medium
 +Descarga dos ficheros, un json con la configuración y el de la voz que ocupa 74Mb
 +   74M es_ES-sharvard-medium.onnx
 +  4.8K es_ES-sharvard-medium.onnx.json
 +Creamos un fichero con esa voz que es casi inmediato:
 +  time python3 -m piper -m es_ES-sharvard-medium -f test.wav -- 'Esto es una pequeña prueba'
 +  real 1.554s
 +  user 2.740s
 +
 +Con una frase mas larga tarda mas o menos lo mismo
 +  time python3 -m piper -m es_ES-sharvard-medium -f test.wav -- 'Esto es una pequeña prueba para ver cuanto puede tardar este programa en reproducir texto a voz.'
 +  real 1.771s
 +  user 3.596s
 +
 +
      
 ====== COQUI TTS ====== ====== COQUI TTS ======
Line 482: Line 524:
     main()     main()
 </code> </code>
 +
 +Luego lo ejecutamos con (cambiar directorio de entreno):
 +  python entrenar_vits.py --device mps --continue_path resultado_entrenamiento/mi_voz_vits_rapida-June-26-2026_05+24PM-ca2cf515 --epochs 200
 +
 +En mi caso:
 +  python entrenar_vits.py --device mps --continue_path resultado_entrenamiento/entrenamiento1 --epochs 200
 +
 +MAC:
 +
 +Las notas de audio están en
 +  open ~/Library/Group\ Containers/group.com.apple.VoiceMemos.shared
 +
 +
 +
 +====== Gráficas de rendimiento ======
 +Levantamos servidor tensor con:
 +  tensorboard --logdir=/Users/T054810/Personal/IA/coqui-ai-TTS_beta/resultado_entrenamiento/
 +
 +Entramos en: http://localhost:6006/
 +
 +Sacado de chatGPT:
 +<code>
 +oss_disc y loss_gen: Son las gráficas de rendimiento del Discriminador y el Generador de VITS. Verás curvas que van bajando. Cuanto más abajo y estables estén, mejor y más limpia sonará tu voz.
 +
 +loss_mel: Te indica cómo de bien está aprendiendo el modelo a imitar las frecuencias exactas de tu tono de voz.
 +
 +Rendimiento de tiempo: Te muestra cuántos segundos tarda por cada paso de entrenamiento.
 +</code>
 +
 +
informatica/inteligencia_artificial/tts.1782477739.txt.gz · Last modified: by jose