(+351) 21 24 10006  ·  info@bconcepts.pt
Carnaxide, Lisboa

AI-901: crear y gestionar pipelines de inferencia con Microsoft Foundry

João Barros 19 de August de 2026 4 min de lectura

Voy a explicar cómo diseñar y gestionar un pipeline de inferencia en Microsoft Foundry — una competencia práctica del AI-901 que aparece en la sección Implementar soluciones de IA con Microsoft Foundry. Saber montar pipelines es esencial para transformar modelos (LLMs, visión, etc.) en servicios fiables y escalables en producción.

Qué necesitas saber

Un pipeline de inferencia es la secuencia de pasos que procesa la entrada del usuario y devuelve la salida del modelo. En Foundry, un pipeline agrupa módulos (components) que hacen preprocesamiento, llamada al modelo, postprocesamiento y lógica de negocio. El objetivo es garantizar que el flujo sea reproducible, trazable y ajustable sin alterar el modelo subyacente.

Ejemplo simple: una aplicación de resumen de texto. Un pipeline típico tiene: (1) recepción del texto; (2) limpieza y truncado; (3) llamada al LLM; (4) filtrado/normalización del resultado; (5) registro de eventos (logging) y retorno. En Foundry, cada paso puede ser un component independiente conectado en una secuencia de ejecución.

Cómo funciona

Principales conceptos y responsabilidades dentro de Foundry:

  • Components: unidades de procesamiento reutilizables (pueden ser código, conectores o modelos).
  • Pipelines: orquestan components, definiendo orden, paralelismo e entradas/salidas.
  • Endpoints de inferencia: puntos expuestos para que los clientes llamen al pipeline como servicio.
  • Gestión de versiones: controlar versiones de components y pipelines para rollback y reproducibilidad.
  • Observabilidad: métricas, logs y tracing para monitorizar latencia, tasas de error y costes.

En un pipeline también puedes definir políticas de retry, timeouts y limitación de tasa (rate limiting) para proteger el servicio y controlar costes. La orquestación debe prever fallos en components externos (p. ej.: API del modelo) y tener caminos alternativos o mensajes de error amigables.

En la práctica

Aquí tienes un paso a paso práctico, simplificado, para crear un pipeline de inferencia de texto en Foundry. Las interfaces concretas pueden variar, pero el flujo conceptual es aplicable.

  1. Definir el requisito: por ejemplo, "resumir artículos de noticias en 3 frases". Define inputs, outputs y SLAs (latencia aceptable).

  2. Crear components:

    // Component: preprocess
    function preprocess(input) {
      // remover caracteres indesejados
      // truncar a N tokens para evitar costes excesivos
      return cleanedText;
    }
    
    // Component: callModel
    async function callModel(cleanedText) {
      // llamar al LLM vía SDK/endpoint de Foundry
      // incluir parámetros: temperatura, max_tokens
      return modelResponse;
    }
    
    // Component: postprocess
    function postprocess(modelResponse) {
      // extraer texto, normalizar espacios, garantizar 3 frases
      return summary;
    }
    

    Cada componente puede implementarse como script o contenedor y registrarse en Foundry.

  3. Orquestar en el pipeline: conecta preprocess → callModel → postprocess. Define timeouts y retries en el componente callModel (p. ej.: 2 retries con backoff exponencial).

  4. Configurar endpoint: define autenticación, throttling y cuotas por usuario. Publica un endpoint HTTP/REST que ejecute el pipeline.

  5. Añadir observabilidad: instrumenta cada component para enviar métricas (latencia, errores) y logs estructurados a OneLake/monitorización.

  6. Probar y validar: realiza pruebas unitarias a los components y pruebas end-to-end con entradas reales. Mide costes por llamada y ajusta truncado/parametrización del modelo.

  7. Gestión de versiones: siempre que cambies un componente o parámetros del modelo, crea una nueva versión del pipeline y conserva la anterior para rollback.

Errores comunes

  • Ignorar límites de tokens o coste: enviar texto muy largo al modelo sin truncar puede disparar costes y errores de cuota. Define preprocesamiento que controle el tamaño de la entrada.
  • Falta de observabilidad: no instrumentar el pipeline impide diagnosticar latencias y fallos; sin métricas no sabes dónde optimizar.
  • Acoplar demasiada lógica al modelo: decisiones de negocio incorporadas en el prompt o en el modelo hacen que las iteraciones sean costosas. Mantén la transformación y validación fuera del modelo cuando sea posible.

Cómo practicar

Practica creando varios pipelines simples en el entorno de entrenamiento de Foundry o en un sandbox: experimenta con LLMs para generación, con modelos de visión para clasificación y con components de filtrado. Para preparar el examen, utiliza el Practice Assessment oficial y gratuito de Microsoft para AI-901 y la study guide oficial (ambos gratuitos). Estos recursos te ayudan a confirmar que dominas los conceptos sin recurrir a materiales prohibidos.

En resumen

  • Los pipelines de inferencia en Foundry encadenan components para preprocesamiento, llamada al modelo y postprocesamiento.
  • Instrumentación, gestión de versiones y configuración de endpoints son esenciales para una producción fiable.
  • Truncado de la entrada, retries y límites de tasa protegen contra costes elevados y fallos.
  • Practica con sandboxes y consulta el Practice Assessment oficial y la study guide de Microsoft — son gratuitos y recomendados.