Saltar al contenido

Reconocimiento de voz

El reconocimiento de voz, reconocimiento automático del habla o ASR es la tecnología que convierte una señal de habla en texto o en una secuencia de palabras. Un sistema analiza el audio, modela sus patrones y decodifica la transcripción más probable. Su calidad depende de idioma, acento, ruido, micrófono, vocabulario y contexto, y debe medirse con grabaciones representativas del uso real.

Actualizado: 13 de julio de 2026.

Qué es el reconocimiento de voz

El reconocimiento de voz convierte habla en una transcripción que una persona o aplicación puede leer, buscar y procesar. Recibe una señal de audio y predice una secuencia de palabras. Se usa para subtítulos, dictado, transcripción de reuniones, comandos, accesibilidad, búsqueda en grabaciones y análisis de llamadas.

El nombre técnico más preciso es reconocimiento automático del habla o ASR, por automatic speech recognition. “Reconocimiento de voz” es la expresión común en español, aunque puede generar confusión con tecnologías que reconocen la identidad del hablante.

Un sistema no “oye” como una persona. Trabaja con muestras digitales, representaciones acústicas y probabilidades aprendidas de grandes colecciones de audio y texto. Por eso puede confundir palabras que suenan parecido, nombres raros, cambios de idioma o voces solapadas.

Cómo funciona el reconocimiento de voz

Un flujo moderno suele incluir estas etapas conceptuales:

  1. Captura de audio. El micrófono o archivo aporta una señal con frecuencia de muestreo, canales y formato determinados.
  2. Preparación. Se normaliza o segmenta el audio y se detectan regiones con habla. Algunos sistemas aplican reducción de ruido.
  3. Representación. El modelo convierte la onda en características o representaciones internas que resumen patrones acústicos.
  4. Predicción. Una red neuronal estima unidades de texto —caracteres, subpalabras o tokens— condicionadas por el audio y el contexto.
  5. Decodificación. Se construye una secuencia probable, a veces con puntuación, marcas de tiempo y alternativas.
  6. Posprocesamiento. Se ajustan mayúsculas, números, nombres, formato y separación de hablantes según el producto.

Los sistemas anteriores separaban con más claridad un modelo acústico, un diccionario de pronunciación y un modelo de lenguaje. Muchos modelos neuronales actuales aprenden gran parte del recorrido de audio a texto de extremo a extremo, aunque una aplicación todavía necesita captura, segmentación, vocabulario, evaluación y manejo de errores.

ASR, STT, TTS y reconocimiento de hablante

TecnologíaEntradaSalidaEjemplo
ASR o reconocimiento del hablaAudio con hablaPalabras o textoTranscribir una entrevista
STT o speech-to-textAudio con hablaTextoDictado en un documento
TTS o texto a vozTextoAudio sintetizadoLeer una respuesta en voz alta
Identificación de hablanteAudioIdentidad entre varias personasSaber quién tomó la palabra
Verificación de hablanteAudio y una identidad declaradaCoincidencia o rechazoValidar una voz registrada
DiarizaciónConversaciónSegmentos por hablanteSeparar “hablante 1” y “hablante 2”

ASR y voz a texto suelen designar la misma función desde ángulos distintos. Texto a voz realiza el proceso opuesto. La diarización no identifica necesariamente nombres: puede separar intervenciones sin saber quién es cada persona.

Ejemplo: transcribir una entrevista

Imagina una grabación de treinta minutos con dos personas, ruido de cafetería y nombres propios. Un prototipo razonable no se limita a subir el archivo y aceptar el texto:

  1. confirma que existe consentimiento y una política de retención;
  2. conserva el original y una transcripción de referencia para evaluar;
  3. selecciona idioma, modelo y canales adecuados;
  4. habilita diarización si las voces no están separadas;
  5. aporta nombres y vocabulario del tema mediante adaptación, si el servicio lo admite;
  6. revisa marcas de tiempo y fragmentos con baja confianza;
  7. corrige términos críticos antes de publicar o analizar.

El resultado puede ser suficiente para búsqueda y resumen, pero no para una cita legal o médica sin revisión. Cada caso necesita un umbral distinto de calidad.

Whisper y modelos de gran escala

Whisper es una familia de modelos publicada por OpenAI. El artículo “Robust Speech Recognition via Large-Scale Weak Supervision” describe entrenamiento con 680.000 horas de audio multilingüe y multitarea procedente de la web. Los autores evaluaron transferencia sin ajuste específico en distintos conjuntos y publicaron modelos y código.

Ese trabajo ayudó a popularizar modelos que se pueden ejecutar localmente, pero “robusto” no significa infalible. Idioma, ruido, dominio, velocidad, acento y calidad de captura cambian el resultado. Los modelos también pueden generar texto durante silencios o música; el sistema debe detectar y revisar esas condiciones.

Cómo medir la precisión: WER

La métrica habitual es word error rate o WER. Compara una hipótesis con una transcripción correcta y cuenta:

  • sustituciones: una palabra aparece en lugar de otra;
  • eliminaciones: falta una palabra;
  • inserciones: aparece una palabra que no se dijo.

La fórmula es (sustituciones + eliminaciones + inserciones) / palabras de referencia. Un WER menor suele indicar una transcripción más cercana, pero no mide todo. Equivocarse en “no” puede ser más grave que fallar tres muletillas; confundir un apellido puede inutilizar una búsqueda aunque el promedio sea bueno.

Google Cloud documenta WER como método estándar en su guía para medir y mejorar la precisión de Speech-to-Text. La evaluación debe usar audio acústicamente representativo: mismo micrófono, entorno, idioma, tipo de hablante y vocabulario que la operación real.

Complementa WER con:

  • exactitud de nombres, cifras y negaciones;
  • calidad de puntuación y marcas de tiempo;
  • error por idioma, acento y grupo de usuarios;
  • latencia hasta el primer y último resultado;
  • tasa de segmentos vacíos o inventados;
  • tiempo humano de corrección por minuto de audio.

Adaptación de vocabulario

Nombres de productos, personas, siglas y jerga aparecen poco en datos generales. Algunos servicios permiten aportar frases o clases para aumentar su probabilidad. La documentación de Google sobre adaptación de modelos explica que se pueden priorizar palabras frecuentes o raras del dominio.

El sesgo debe calibrarse. Aumentar demasiado el peso de una frase reduce omisiones, pero también puede hacer que el sistema la inserte cuando no fue pronunciada. Prueba valores sobre un conjunto reservado y registra falsos positivos y negativos.

Usos del reconocimiento de voz

  • Accesibilidad: dictado, subtítulos y control por comandos.
  • Educación: transcripción de clases autorizadas y búsqueda en material audiovisual.
  • Reuniones: notas, decisiones y tareas con revisión de participantes.
  • Medios: subtítulos, archivo y localización de fragmentos.
  • Soporte: transcripción de llamadas y control de calidad.
  • Dispositivos: activación de funciones mediante expresiones limitadas.
  • Investigación: convertir entrevistas en texto analizable, manteniendo audio y consentimiento.

Una transcripción facilita el procesamiento del lenguaje natural, pero los errores de ASR se propagan al resumen, búsqueda o clasificación posterior. Evalúa el sistema completo, no solo el primer modelo.

Privacidad, sesgos y riesgos

La voz puede contener datos personales, información confidencial y rasgos que permiten inferencias sobre una persona. Define quién puede grabar, dónde se procesa el audio, durante cuánto tiempo se conserva y quién accede a transcripciones y archivos.

Los errores tampoco se distribuyen necesariamente de forma uniforme. Un promedio global puede ocultar peores resultados para determinados acentos, edades, entornos o condiciones del habla. Divide las métricas por grupos relevantes y permite corrección o canal alternativo.

Otros controles importantes:

  • cifrado y acceso mínimo para audio y texto;
  • consentimiento visible y opción de detener la grabación;
  • eliminación programada de archivos no necesarios;
  • revisión antes de decisiones sensibles;
  • no usar una transcripción como prueba única de identidad;
  • registro de modelo, configuración e idioma usados.

Errores frecuentes al implementar ASR

  • Probar solo con audio de estudio. El entorno real puede contener eco, teléfonos y voces simultáneas.
  • Elegir el idioma equivocado. La detección automática no siempre resuelve conversaciones mezcladas.
  • Ignorar términos críticos. Nombres, cifras y negaciones necesitan métricas específicas.
  • Aceptar una confianza como verdad. La calibración de confianza cambia entre modelos y contextos.
  • Borrar el vínculo con el audio. Sin marcas de tiempo resulta difícil revisar una frase.
  • Automatizar una decisión desde texto imperfecto. Conserva revisión humana donde el error tiene consecuencias.

Cómo elegir un sistema

Prepara primero un conjunto pequeño de grabaciones reales y una transcripción de referencia. Compara calidad, latencia, idiomas, diarización, adaptación, despliegue, privacidad y coste con la misma muestra. Evita decidir por una demo del proveedor.

El mejor sistema no es siempre el de menor WER agregado. Para subtítulos en directo puede importar más la latencia; para archivo legal, exactitud y trazabilidad; para datos sensibles, control del entorno y retención. Define la métrica según el resultado que necesita la persona usuaria.

Fuentes primarias y documentación

Preguntas frecuentes

¿Qué es el reconocimiento de voz?
Es una tecnología que transforma habla grabada o en directo en palabras. El sistema procesa la señal acústica y estima la transcripción más probable. También se conoce como reconocimiento automático del habla, ASR o, en muchos productos, voz a texto.
¿Reconocimiento de voz y voz a texto son lo mismo?
En la práctica suelen usarse como sinónimos cuando el resultado es una transcripción. Sin embargo, reconocimiento de voz también puede referirse a interpretar comandos, y no debe confundirse con reconocimiento de hablante, que intenta identificar o verificar quién habla.
¿Cómo se mide la precisión de una transcripción?
La métrica común es la tasa de error de palabras o WER, que cuenta sustituciones, eliminaciones e inserciones respecto de una transcripción de referencia y divide por las palabras de esa referencia. Debe calcularse sobre audio representativo y complementarse con errores críticos del dominio.
¿Qué mejora el reconocimiento del habla?
Ayudan un audio claro, idioma y modelo correctos, buen micrófono, separación de hablantes y adaptación de vocabulario para nombres o términos del dominio. La mejora debe confirmarse con un conjunto de evaluación; aumentar el sesgo de una frase también puede crear falsos positivos.

Términos relacionados

02 / LLEVAR A LA PRÁCTICA

Después de leer

Convierte una idea útil en una habilidad repetible.

Elige una ruta breve, aplícala a una tarea real y termina con algo que puedas revisar, usar o compartir.

Hablar por WhatsApp