(+351) 21 24 10006  ·  info@bconcepts.pt
Carnaxide, Lisboa

AI-901: implementar clasificadores de texto con Microsoft Foundry

João Barros 04 de September de 2026 4 min de lectura

En esta guía explico cómo implementar un clasificador de texto usando Microsoft Foundry — desde preparar datos etiquetados hasta entrenar y evaluar el modelo. Esta competencia es frecuente en el área "Identificar conceptos y capacidades de IA" y es muy útil en la práctica para automatizar el cribado de mensajes, la categorización de tickets y la moderación.

Lo que necesitas saber

Un clasificador de texto asigna etiquetas a fragmentos de texto (por ejemplo: "soporte", "ventas", "spam"). Conceptos clave: etiquetas (labels), entrenamiento supervisado, conjunto de entrenamiento/validación/prueba, métricas (accuracy, precision, recall, F1), sobreajuste (overfitting) y preprocesamiento (tokenización, limpieza). En Foundry usas un pipeline que prepara los datos, elige un algoritmo (o un modelo preentrenado) y ejecuta entrenamiento y evaluación. Ejemplo: tienes 3.000 correos etiquetados como {"Suporte","Vendas","Outros"}. Vas a dividir los datos, entrenar y confirmar que el modelo distingue bien las clases.

Cómo funciona

Pasos esenciales, a alto nivel:

  1. Creación y etiquetado: obtener ejemplos representativos para cada etiqueta.
  2. Limpieza y preprocesamiento: normalizar mayúsculas/minúsculas, eliminar HTML, tokenizar y, posiblemente, aplicar lematización/stemming.
  3. División de los datos: típicamente 70% entrenamiento, 15% validación, 15% prueba (ajusta según la disponibilidad).
  4. Elección del modelo: modelos ligeros (Logistic Regression, Naive Bayes) para baseline; luego experimentar con modelos del ecosistema de LLMs o embeddings combinados con un clasificador.
  5. Entrenamiento y validación: ajustar hiperparámetros, usar early stopping para reducir overfitting.
  6. Evaluación: calcular accuracy, precision, recall y F1 por clase; analizar la matriz de confusión.
  7. Despliegue: empaquetar el pipeline en Foundry como endpoint de inferencia.

Ejemplo conceptual de preprocesamiento en pseudo-código (puede ejecutarse en notebooks dentro de Foundry):

# Exemplo simplificado de pré-processamento
def preprocess(text):
    text = text.lower()
    text = remove_html(text)
    text = remove_punctuation(text)
    tokens = tokenize(text)
    tokens = remove_stopwords(tokens)
    return ' '.join(tokens)

corpus = [preprocess(t) for t in textos]

En la práctica (paso a paso en Foundry)

Resumen de las acciones concretas que vas a ejecutar en Microsoft Foundry:

  1. Importar datos: cargar el conjunto etiquetado (CSV, parquet) en el workspace de datos de Foundry y validar la integridad.
  2. Explorar y limpiar: usar notebooks o las herramientas de preparación de datos para inspeccionar etiquetas desbalanceadas, eliminar duplicados y aplicar el preprocesamiento.
  3. Generar features: optar por BoW/TF-IDF o embeddings. Para un prototipo rápido, genera TF-IDF; para mejores resultados, obtén embeddings con un modelo soportado por Foundry y úsalos como input del clasificador.
  4. Entrenar: crear un experimento de entrenamiento que utilice un algoritmo (ej.: Logistic Regression, XGBoost) o un modelo supervisado sobre embeddings. Configura checkpoints y validación cruzada, si procede.
  5. Evaluar: generar métricas por clase y matriz de confusión. Examina ejemplos mal clasificados para identificar patrones (por ejemplo, etiquetas ambiguas).
  6. Publicar endpoint: empaqueta el pipeline de preprocesamiento + modelo como un endpoint de inferencia en Foundry; prueba con ejemplos reales antes de producción.

Ejemplo de evaluación en pseudo-código (notebook):

from sklearn.metrics import classification_report, confusion_matrix
preds = model.predict(X_test)
print(classification_report(y_test, preds))
print(confusion_matrix(y_test, preds))

Errores comunes

1) Clases desbalanceadas: entrenar sin tratar el desbalance (undersampling/oversampling/ponderación de clases) conduce a métricas engañosas (alta accuracy pero mala detección de las clases menos representadas).

2) Fuga de datos (data leakage): incluir metadata o información del futuro en el entrenamiento (por ejemplo, campos derivados de la etiqueta) o no separar correctamente conjuntos de entrenamiento/validación/prueba falsea la evaluación.

3) Confiar solo en una métrica global: la accuracy puede ocultar bajas precisiones por clase. Usa precision/recall/F1 por etiqueta y analiza la matriz de confusión.

Cómo practicar

Para preparar el AI-901 practica este flujo con pequeños datasets públicos (ej.: conjuntos de reviews, emails, tickets). Microsoft proporciona un Practice Assessment OFICIAL gratuito; úsalo para evaluar los conocimientos del examen. Consulta también la study guide oficial de Microsoft, que es gratuita y lista los temas del examen. No uses ni compartas materiales no oficiales como "exam dumps" — céntrate en aprender los conceptos y en aplicarlos en Foundry.

En resumen

  • Un clasificador de texto mapea entradas a etiquetas; requiere datos etiquetados, preprocesamiento y una evaluación cuidadosa.
  • En Foundry construyes pipelines que preparan datos, generan features (TF-IDF o embeddings), entrenan y publican endpoints de inferencia.
  • Evita el desbalance, el data leakage y las métricas únicas — analiza precision/recall/F1 y la matriz de confusión.
  • Practica con datasets públicos y usa el Practice Assessment oficial y la study guide gratuita de Microsoft para validar conocimientos.