(+351) 21 24 10006  ·  info@bconcepts.pt
Carnaxide, Lisboa

AI-901: cómo integrar servicios de Speech en Microsoft Foundry

João Barros 06 de October de 2026 5 min de lectura

En esta guía voy a enseñar cómo implementar e integrar servicios de Speech (reconocimiento de voz y síntesis de voz) en Microsoft Foundry — competencia útil tanto para el examen AI-901 como para crear aplicaciones conversacionales, transcripción automática y accesibilidad. Nos centraremos en los conceptos esenciales y en un flujo práctico para conectar Speech Services a pipelines del Foundry.

Qué necesitas saber

Speech Services de Azure incluyen dos bloques principales: Speech-to-Text (STT) para transcribir voz a texto, y Text-to-Speech (TTS) para sintetizar voz a partir de texto. En el contexto de Microsoft Foundry, el papel del Foundry es orquestar pipelines de datos e inferencia, incluyendo llamadas a servicios gestionados de Azure o a modelos locales. La integración permite, por ejemplo, ingestión de audio de varias fuentes, procesamiento (limpieza, normalización), transcripción mediante Speech-to-Text, posprocesamiento del texto (normalización, detección de idioma) y, si se desea, síntesis de respuesta con Text-to-Speech.

Ejemplo práctico: imagina un pipeline que recibe archivos de audio grabados por agentes de un call center. El Foundry realiza la ingestión de esos archivos, llama al servicio Speech-to-Text, almacena las transcripciones en una tabla de OneLake y marca automáticamente llamadas que contengan ciertas palabras clave para análisis posterior.

Cómo funciona

Los pasos generales para integrar Speech Services con Foundry son:

  1. Configurar un recurso Speech en Azure (clave y endpoint) o usar un endpoint gestionado compatible.
  2. En el Foundry, crear un pipeline que realice la ingestión del archivo de audio (WAV/MP3) a OneLake o a un dataset temporal.
  3. Agregar un componente de inferencia que llame al endpoint Speech-to-Text, enviando el audio o una URL al archivo en OneLake.
  4. Recibir la respuesta (JSON con transcripciones, timestamps, confianza) y aplicar transformaciones: limpiar texto, normalizar puntuación, identificar idioma.
  5. Guardar la transcripción y metadatos (duración, confianza media) en una tabla para informes o desencadenar pasos subsiguientes (p. ej., análisis de sentimiento, marcación de llamadas).
  6. Si es necesario devolver audio (respuestas automatizadas), llamar al servicio Text-to-Speech con el texto producido y almacenar/hacer streaming del output de audio.

Ejemplo de payload simplificado para STT (enviado por el Foundry a un endpoint REST de Azure Speech):

{
  "audioUrl": "https://onelake/.../call123.wav",
  "language": "pt-PT",
  "properties": { "diarizationEnabled": true }
}

Respuesta típica (simplificada):

{
  "transcription": "Olá, bom dia. Gostava de falar sobre a minha fatura.",
  "confidence": 0.93,
  "segments": [ { "start": 0.0, "end": 2.5, "text": "Olá, bom dia." }, ... ]
}

En la práctica (paso a paso dentro del Foundry)

1) Preparar credenciales: añade las claves/endpoint del Speech como secretos en el Foundry para evitar exponer credenciales en código.

2) Ingestión: crea un dataset que apunte al lugar donde llegan los archivos de audio (Blob/OneLake). Normaliza formatos (usar WAV mono a 16 kHz cuando sea posible).

3) Componente de inferencia: usa un operador HTTP o un conector nativo (si está disponible) para llamar al servicio Speech. Define timeouts y políticas de retry; el audio puede ser enviado por URL o en streaming.

4) Posprocesamiento: aplica transformaciones con scripts (Python/SQL) en el pipeline del Foundry para limpiar la transcripción — eliminar ruido, normalizar caracteres, aplicar mayúsculas/minúsculas y puntuación automática si es necesario.

5) Almacenamiento y acción: graba la transcripción en una tabla y crea triggers en el pipeline para ejecutar análisis adicionales (p. ej., detección de intenciones, análisis de sentimiento, generación de tickets).

6) Text-to-Speech (opcional): cuando el flujo exige respuesta en audio, invoca el endpoint TTS con el texto final y guarda el archivo de audio para hacer streaming al usuario.

Errores comunes

1) Audio con formato o tasa de muestreo inadecuada: enviar MP3 de baja calidad o tasas de muestreo no soportadas reduce la precisión. Convierte a WAV 16 kHz mono cuando sea posible.

2) Exponer credenciales en el pipeline: colocar claves directamente en scripts o código en el Foundry es un riesgo. Utiliza el gestor de secretos del Foundry y controles de acceso.

3) Ignorar la gestión de latencia y costes: llamadas frecuentes a servicios de Speech pueden generar costes y latencia. Agrupa archivos, usa transcripción por batch para archivos grandes y ajusta políticas de retry/timeout.

Cómo practicar

Para practicar, utiliza el Practice Assessment OFICIAL de Microsoft (gratuito) para familiarizarte con el formato del examen. Consulta también la study guide de Microsoft (gratuita) sobre Azure AI Fundamentals y Speech Services para repasar conceptos y ejemplos oficiales. En la práctica, monta un pequeño laboratorio: crea un recurso Speech en tu suscripción de Azure gratuita, sube algunos archivos de audio a OneLake o Blob Storage y construye un pipeline simple en el Foundry que llame al Speech-to-Text y registre transcripciones. Evita usar contenido real sensible durante las pruebas.

En resumen

  • Speech Services engloba Speech-to-Text y Text-to-Speech; en el Foundry sirve para transcribir audio y sintetizar respuestas.
  • Flujo típico: ingestión de audio → llamada STT → posprocesamiento → almacenamiento/acciones; TTS es opcional para respuesta en audio.
  • Buenas prácticas: normalizar formato de audio, usar secretos para credenciales y gestionar latencia/costes con batch y políticas de retry.
  • Practica con el Practice Assessment oficial y la study guide de Microsoft; monta un laboratorio con un recurso Speech y un pipeline en el Foundry.