Reconocimiento de voz¶
Una reunión, una clase y una formación llegan a Agora como voz y nada más: la pista de subtítulos que trae consigo la señal de un difusor aquí no existe ni tiene de dónde salir. Y son justamente esas grabaciones las que después se buscan en el archivo y se miran en diferido. El reconocimiento de voz cierra ese hueco: el servidor lee él mismo el audio de la transmisión grabada y le añade una pista de subtítulos.
La transmisión en directo no se toca en absoluto. El reconocimiento trabaja sobre el archivo: lee el audio grabado y escribe allí mismo los subtítulos. De ahí se derivan dos consecuencias que conviene saber de antemano.
- La transmisión necesita archivo. Sin grabación el reconocimiento no tiene de dónde tomar el audio ni dónde escribir el resultado.
- Retrasarse es inofensivo. Si el reconocimiento no sigue el ritmo del directo, los subtítulos se retrasan y luego alcanzan; a la transmisión misma no le afecta en nada.
Cómo activarlo¶
El reconocimiento vive en la pestaña Procesamiento de la ficha de la transmisión — la misma que los subtítulos, el teletexto y las miniaturas —, en la sección Reconocimiento de voz. Lo activa el interruptor Reconocer voz en subtítulos.

Hay cuatro campos y ninguno es obligatorio: los valores por defecto bastan para activar el reconocimiento con un solo interruptor.
| Campo | Qué define |
|---|---|
| Modelo | El tamaño del reconocedor. Un modelo más grande es más preciso, pero más lento y necesita más memoria. |
| Idioma | Un código ISO-639-1, por ejemplo es. Vacío significa detectarlo por el audio. |
| Fuente de audio | La pista de la señal que hay que escuchar. Por defecto la primera. |
| Ventana de reconocimiento, s | Hasta 120 segundos. Una ventana larga entiende mejor el sentido, pero la frase aparece más tarde. |
Indique el idioma si lo conoce. La detección decide por los primeros segundos de audio y se equivoca en una grabación que empieza con música o con silencio — y un idioma equivocado estropea toda la pista, no una sola frase.
La fuente de audio importa cuando la señal trae varios idiomas: el reconocimiento escucha exactamente una pista. Si la pista elegida no está en el aire, el estado lo dice: «La pista de audio elegida no está en el aire».
Sin grabación no arranca¶
Si activa el reconocimiento en una transmisión sin grabación, el panel responde al momento, sin esperar a que se guarde:

Esto no prohíbe guardar el ajuste; avisa de que el ajuste no va a funcionar. Dele a la transmisión un archivo — vive en la pestaña vecina DVR de la misma ficha — y el reconocimiento se levantará solo.
Estado del reconocimiento¶
Debajo del formulario el panel muestra lo que está pasando de verdad. Es el único sitio donde se ve el trabajo vivo del reconocimiento: la ficha de la transmisión toma el estado del nodo donde la transmisión se graba.

- En marcha / Detenido — si el reconocimiento está levantado. «Detenido» viene siempre con un motivo en palabras.
- Retraso — cuánto va por detrás del momento actual lo ya reconocido. En el directo son segundos; en un archivo que el reconocimiento alcanza desde el principio, horas, y ese es un modo de trabajo normal, no un fallo.
- Audio reconocido — cuánto audio ha pasado ya por el reconocedor.
- Frases — cuántas líneas de subtítulos se han escrito.
- Errores — fallos de lectura del archivo y de reconocimiento. Cero aquí es el estado habitual.
- Última frase — cuándo escribió algo el reconocimiento por última vez.
El panel nombra directamente los motivos por los que el reconocimiento no se levanta:
| Qué pone | Qué hacer |
|---|---|
| El stream no tiene grabación de archivo | Activar el archivo en la pestaña DVR. |
| No se encontró el fichero del modelo o no se cargó | Poner el fichero del modelo en el servidor (más abajo). |
| La pista de audio elegida no está en el aire | Elegir otra fuente de audio o dejar el valor por defecto. |
| El reconocedor no conoce ese idioma | Comprobar el código de idioma o vaciar el campo. |
| Compilación del servidor sin reconocimiento de voz | Contactar con soporte: el equipo está compilado sin el motor. |
Un reconocimiento en marcha con un error reciente es un aviso, no una avería: un trozo no leído no detiene el trabajo, el reconocimiento sigue con el siguiente.
El fichero del modelo¶
El modelo en sí no viene con el servidor: uno utilizable pesa más de un gigabyte, y cuál hace falta lo decide el dueño del equipo. El servidor lo busca en el directorio de estado del producto — /var/lib/agora/whisper-models — y espera allí un fichero ggml-<modelo>.bin, es decir ggml-medium.bin para el modelo medium.
Mientras el fichero no está, el estado del reconocimiento dice honestamente «No se encontró el fichero del modelo o no se cargó», y la transmisión sigue emitiendo y grabando como si nada.
Un solo fichero sirve a todas las transmisiones del equipo: el modelo se lee en memoria una vez por proceso, por muchas transmisiones que lo pidan.
Qué recibe el espectador¶
Lo reconocido se convierte en una pista de subtítulos corriente de la transmisión: se ve en la información de medios, viaja en HLS y DASH y se activa en el reproductor igual que cualquier otra.
Tiene sentido verla en el archivo. En el directo los subtítulos todavía no están — aparecen con ese mismo retraso que muestra el estado —, mientras que la grabación de una reunión se abre ya con el texto.
Qué sigue¶
- Archivo — sin lo cual el reconocimiento no arranca.
- Transmisiones — la ficha en cuyas pestañas vive todo esto.
- Reproducción y acceso — cómo abre el espectador una grabación.