(+351) 21 24 10006  ·  info@bconcepts.pt
Carnaxide, Lisboa

AI-901: como integrar serviços de Speech no Microsoft Foundry

João Barros 06 de October de 2026 5 min de leitura

Neste guia vou ensinar como implementar e integrar serviços de Speech (reconhecimento de fala e síntese de voz) no Microsoft Foundry — competência útil tanto para o exame AI-901 como para criar aplicações conversacionais, transcrição automática e acessibilidade. Vamos focar nos conceitos essenciais e num fluxo prático para ligar Speech Services a pipelines do Foundry.

O que precisas de saber

Speech Services da Azure incluem dois blocos principais: Speech-to-Text (STT) para transcrever fala em texto, e Text-to-Speech (TTS) para sintetizar voz a partir de texto. No contexto do Microsoft Foundry, o papel do Foundry é orquestrar pipelines de dados e inferência, incluindo chamadas a serviços geridos da Azure ou a modelos locais. A integração permite, por exemplo, ingestão de áudio de várias fontes, processamento (limpeza, normalização), transcrição por Speech-to-Text, pós-processamento do texto (normalização, deteção de idioma) e, se desejado, síntese de resposta com Text-to-Speech.

Exemplo prático: imagina um pipeline que recebe ficheiros de áudio gravados por agentes de call center. O Foundry faz ingestão desses ficheiros, chama o serviço Speech-to-Text, armazena as transcrições numa tabela do OneLake e assinala automaticamente chamadas que contenham certas palavras-chave para análise posterior.

Como funciona

Os passos gerais para integrar Speech Services com Foundry são:

  1. Configurar um recurso Speech no Azure (chave e endpoint) ou usar um endpoint gerido compatível.
  2. No Foundry, criar um pipeline que faça a ingestão do ficheiro áudio (WAV/MP3) para OneLake ou para um dataset temporário.
  3. Adicionar um componente de inferência que chama o endpoint Speech-to-Text, enviando o áudio ou um URL para o ficheiro em OneLake.
  4. Receber a resposta (JSON com transcrições, timestamps, confiança) e aplicar transformações: limpar texto, normalizar pontuação, identificar idioma.
  5. Guardar a transcrição e metadados (duração, confiança média) numa tabela para relatórios ou acionar passos subsequentes (p. ex., análise de sentimento, assinalamento de chamadas).
  6. Se for necessário devolver áudio (respostas automatizadas), chamar o serviço Text-to-Speech com o texto produzido e armazenar/fazer streaming do output de áudio.

Exemplo de payload simplificado para STT (enviado pelo Foundry a um endpoint REST da Azure Speech):

{
  "audioUrl": "https://onelake/.../call123.wav",
  "language": "pt-PT",
  "properties": { "diarizationEnabled": true }
}

Resposta típica (simplificada):

{
  "transcription": "Olá, bom dia. Gostava de falar sobre a minha fatura.",
  "confidence": 0.93,
  "segments": [ { "start": 0.0, "end": 2.5, "text": "Olá, bom dia." }, ... ]
}

Na prática (passo-a-passo dentro do Foundry)

1) Preparar credenciais: adiciona as chaves/endpoint do Speech como segredos no Foundry para evitar expor credenciais em código.

2) Ingestão: cria um dataset que aponta para o local onde os ficheiros de áudio chegam (Blob/OneLake). Normaliza formatos (usar 16 kHz WAV mono quando possível).

3) Componente de inferência: usa um operador HTTP ou um conector nativo (se disponível) para chamar o serviço Speech. Define timeouts e políticas de retry; áudio pode ser enviado por URL ou em streaming.

4) Pós-processamento: aplica transformações com scripts (Python/SQL) no pipeline do Foundry para limpar a transcrição — remover ruído, normalizar caracteres, aplicar caixa alta/baixa e pontuação automática se necessário.

5) Armazenamento e ação: grava a transcrição numa tabela e cria triggers no pipeline para executar análises adicionais (p. ex., deteção de intenções, análise de sentimento, geração de tickets).

6) Text-to-Speech (opcional): quando o fluxo exige resposta em áudio, invoca o endpoint TTS com o texto final e guarda o ficheiro áudio para streaming ao utilizador.

Erros comuns

1) Áudio com formato ou taxa de amostragem inadequada: enviar MP3 de baixa qualidade ou taxas de amostragem não suportadas diminui a precisão. Converte para WAV 16 kHz mono quando possível.

2) Expor credenciais no pipeline: colocar chaves diretamente em scripts ou código no Foundry é um risco. Usa o gestor de segredos do Foundry e controlos de acesso.

3) Ignorar gestão de latência e custos: chamadas frequentes a serviços de Speech podem gerar custos e latência. Agrupa ficheiros, usa transcrição em batch para ficheiros grandes e ajusta políticas de retry/timeout.

Como praticar

Para praticar, usa o Practice Assessment OFICIAL da Microsoft (gratuito) para te familiarizares com o formato do exame. Consulta também a study guide da Microsoft (gratuita) sobre Azure AI Fundamentals e Speech Services para rever conceitos e exemplos oficiais. Na prática, monta um pequeno laboratório: cria um recurso Speech na tua subscrição Azure gratuita, carrega alguns ficheiros de áudio em OneLake ou Blob Storage e constrói um pipeline simples no Foundry que chama o Speech-to-Text e grava transcrições. Evita usar conteúdo real sensível durante os testes.

Em resumo

  • Speech Services engloba Speech-to-Text e Text-to-Speech; no Foundry serve para transcrever áudio e sintetizar respostas.
  • Fluxo típico: ingestão de áudio → chamada STT → pós-processamento → armazenamento/ações; TTS é opcional para resposta em áudio.
  • Boas práticas: normalizar formato de áudio, usar segredos para credenciais e gerir latência/custos com batch e políticas de retry.
  • Pratica com o Practice Assessment oficial e a study guide da Microsoft; monta um laboratório com um recurso Speech e um pipeline no Foundry.