(+351) 21 24 10006  ·  info@bconcepts.pt
Carnaxide, Lisboa

AI-901: validar y evaluar modelos de IA con Microsoft Foundry

João Barros 12 de September de 2026 5 min de lectura

Voy a enseñar cómo validar y evaluar modelos de IA dentro de Microsoft Foundry — una competencia esencial en el AI-901 porque garantiza que el modelo cumple requisitos de calidad antes de usarse en producción. Saber medir rendimiento, elegir métricas y crear conjuntos de validación es crítico tanto para el examen como para escenarios reales.

Qué necesitas saber

Validar y evaluar un modelo significa medir su comportamiento con datos que no se usaron en el entrenamiento, identificar fallos y cuantificar su utilidad para la tarea. En Foundry, esto implica: preparar un conjunto de validación, ejecutar inferencia controlada y calcular métricas apropiadas (por ejemplo, accuracy, precision/recall, F1, AUC para clasificación; MAE, RMSE para regresión). También incluye evaluar robustez, sesgo y rendimiento temporal/latencia.

Ejemplo simple: tienes un clasificador binario para detectar mensajes de spam. Tras entrenar en Foundry, preparas un conjunto de validación con mensajes etiquetados (spam/no spam) que no estuvieron en el entrenamiento. Ejecutas un job de inferencia en Foundry que aplica el modelo al conjunto de validación y generas métricas como accuracy, recall y F1. Si el recall es muy bajo, muchos mensajes de spam se escapan — es una señal para ajustar el threshold, recopilar más ejemplos o revisar el preprocesamiento.

Cómo funciona (paso a paso)

Sigue un flujo práctico y aplicable en Foundry:

  1. Definir objetivos de evaluación:

    Determina qué importa: minimizar falsos positivos, maximizar recall, reducir latencia o garantizar equidad. Esa decisión orienta las métricas y el diseño de las pruebas.

  2. Preparar conjuntos de validación y prueba:

    Separar datos que no se usaron en el entrenamiento. Idealmente tienes tres conjuntos: entrenamiento, validación (para ajuste) y test (evaluación final). En Foundry, usa archivos en OneLake o tablas versionadas.

  3. Ejecutar inferencia controlada:

    # Exemplo conceptual de pipeline de inferência
    # 1. Carregar dados de validação
    # 2. Aplicar transformações idênticas às do treino
    # 3. Chamar o modelo para previsões
    # 4. Guardar previsões para análise
    

    En Foundry, esto normalmente es un Job que lee datos, aplica el modelo y graba resultados versionados.

  4. Calcular métricas relevantes:

    Para clasificación: matriz de confusión, accuracy, recall, F1, AUC. Para regresión: MAE, RMSE, R². Para modelos de lenguaje: perplexity, BLEU (para generación) o métricas específicas de tarea. Implementa la lógica de cálculo como parte del pipeline o usa componentes/visualizaciones de Foundry.

  5. Pruebas adicionales:

    • Robustez: probar con ruido/inputs adversariales.
    • Generalización temporal: validar con datos más recientes para detectar degradación.
    • Equidad y sesgo: analizar métricas por subgrupos demográficos.
  6. Documentar y versionar resultados:

    Almacenar métricas, conjuntos de datos y el artefacto del modelo (versión) en Foundry para auditoría y regresión de resultados.

En la práctica — ejemplo rápido

Imagina un pipeline de clasificación que ya existe en Foundry. Para añadir una etapa de evaluación puedes:

  1. Crear un conjunto de datos validation_set en OneLake con N registros etiquetados.
  2. Crear un Job de inferencia que:
# Pseudocódigo do Job
validation = read_table('oneLake://project/validation_set')
preprocessed = apply_transform(validation)
preds = model.predict(preprocessed)
results = join(validation.labels, preds)
save_table(results, 'oneLake://project/eval_results')
# Calcular métricas (no mesmo Job ou num Job separado)
metrics = compute_metrics(results)
save_table(metrics, 'oneLake://project/eval_metrics')

Después, crea un dashboard en Foundry que muestre la evolución de las métricas por versión del modelo y por fecha. Esto ayuda a detectar deriva (data drift) o caída de rendimiento rápidamente.

Errores comunes

  • Usar los mismos datos para entrenamiento y validación: conduce a métricas excesivamente optimistas. Siempre separar conjuntos o usar validación cruzada.
  • Elegir métricas sin relación con los requisitos del negocio: por ejemplo, centrarse en accuracy cuando el coste de los falsos negativos es alto. Define métricas alineadas con el impacto real.
  • Ignorar subgrupos y equidad: la media global de rendimiento puede ocultar fallos profundos en grupos específicos.

Cómo practicar

Para practicar esta competencia, usa el Practice Assessment OFICIAL y gratuito de Microsoft y la study guide oficial (también gratuita). Estos recursos te ayudan a verificar conocimientos generales del examen AI-901 y a orientar el estudio práctico en temas como validación de modelos. Además, en Foundry, crea pequeños proyectos de extremo a extremo: entrena un modelo simple, versionalo, construye un Job de evaluación y registra métricas a lo largo del tiempo.

En resumen

  • Validar modelos exige conjuntos separados, métricas apropiadas y pruebas de robustez para asegurar calidad antes de producción.
  • En Microsoft Foundry, construye pipelines de inferencia y evaluación que versionan datos, resultados y artefactos para trazabilidad.
  • Elige métricas alineadas con el riesgo de negocio y analiza rendimiento por subgrupos para detectar sesgos.
  • Practica con los recursos oficiales de Microsoft (Practice Assessment y study guide gratuitos) e implementa pipelines simples en Foundry para ganar experiencia práctica.