(+351) 21 24 10006  ·  info@bconcepts.pt
Carnaxide, Lisboa

AI-901: implementar pipelines de pré-processamento de dados no Microsoft Foundry

João Barros 28 de September de 2026 4 min de leitura

Vou explicar como implementar pipelines de pré-processamento de dados no Microsoft Foundry — uma competência prática útil para o AI-901. Preparar correctamente os dados antes de inferir ou treinar modelos é crítico tanto para a precisão dos resultados como para a operacionalização segura em produção.

O que precisas de saber

Pré-processamento de dados significa transformar dados brutos numa forma adequada para modelos de IA ou para fluxos de inferência. No contexto do Microsoft Foundry (parte do ecossistema Fabric/OneLake), isto inclui: limpeza (remover duplicados, tratar valores nulos), normalização/escalamento, tokenização para texto, redimensionamento/normalização para imagens e transformação de colunas categóricas em representações numéricas.

Exemplo: tens registos de transacções com campos de texto livre, datas em vários formatos e uma coluna de montante com símbolo. Um pipeline de pré-processamento típico vai: (1) unificar formatos de data, (2) remover símbolos e converter montantes para float, (3) imputar ou remover valores nulos, (4) extrair características temporais (dia da semana, hora), (5) exportar um ficheiro/tabela normalizada para consumo por um modelo ou por um endpoint de inferência.

Como funciona

No Foundry implementas pipelines de pré-processamento juntando componentes que transformam dados em etapas reprodutíveis. Tipicamente usas:

  • Datasets ou tables em OneLake como fonte/target.
  • Transforms/activities do Foundry para executar código (Python, PySpark) ou operadores visuais.
  • Ferramentas de orquestração para agendar e versionar pipelines.

Fluxo lógico de um pipeline:

  1. Ingestão: carregar dados brutos para uma tabela staging.
  2. Validação: checks automáticos (schema, tipos, ranges).
  3. Limpeza: remover duplicados, normalizar textos e números.
  4. Transformação: criar features (one-hot, embeddings simples, normalização).
  5. Exportação: gravar tabela pronta para treino/inferência e registar metadados.

Na prática

Aqui tens um exemplo simplificado em pseudo-Python/PySpark que podes adaptar como transform no Foundry. Assume que lês uma tabela OneLake chamada transactions_raw e gravarás transactions_clean.

# Exemplo simplificado de transform (pseudo-PySpark)
from pyspark.sql import functions as F

df = spark.read.table('oneLake.transactions_raw')

# Normalizar datas
df = df.withColumn('transaction_date', F.to_timestamp(F.col('date_str'), 'yyyy-MM-dd HH:mm:ss'))

# Limpar montantes: remover símbolos e converter
df = df.withColumn('amount_clean', F.regexp_replace(F.col('amount'), '[^0-9.-]', '').cast('double'))

# Imputar valores nulos (ex.: 0 para montantes, 'unknown' para categorias)
df = df.fillna({'amount_clean': 0.0, 'category': 'unknown'})

# Extrair features temporais
df = df.withColumn('day_of_week', F.dayofweek('transaction_date'))

# One-hot simples para categoria (exemplo conceptual)
categories = ['food','travel','utilities']
for c in categories:
    df = df.withColumn(f'cat_{c}', F.when(F.col('category') == c, 1).otherwise(0))

# Gravar tabela limpa
df.write.mode('overwrite').saveAsTable('oneLake.transactions_clean')

Notas práticas:

  • Valida o schema antes e depois; o Foundry permite registar schema e lineage para auditoria.
  • Se trabalhares com texto para LLMs, acrescenta tokenização/limpeza específica e limita o tamanho para controlar custos de inferência.
  • Para imagens, inclui redimensionamento, conversão de formato e normalização dos valores de pixel.

Erros comuns

  • Não versionar transforms: alterar o código sem versionamento compromete a reprodutibilidade. Usa o controlo de versões integrado no Foundry para registar cada transform.
  • Fazer transformações diferentes no treino e na inferência: se o pipeline de treino normaliza ou codifica dados de forma X, o pipeline de inferência deve aplicar exactamente a mesma lógica e parâmetros.
  • Ignorar validação de entrada: assumir que os dados chegam sempre no formato esperado (por exemplo, datas ou símbolos) leva a falhas em produção. Implementa checks e alertas.

Como praticar

Para estudarem esta competência, utilizem os recursos oficiais gratuitos da Microsoft:

  • Practice Assessment OFICIAL da Microsoft (gratuito) — é a tua referência para te familiarizares com o formato do exame e as áreas medidas.
  • Study guide oficial do exame AI-901 (gratuito) — contém as skills measured e recursos recomendados.

Na prática, cria um pequeno projecto no Foundry (ou ambiente Fabric/OneLake a que tenhas acesso): ingere um CSV, implementa um transform em Python/PySpark com validações e exporta a tabela limpa. Testa o mesmo pipeline com dados de exemplo e com dados “ruidosos” para verificar a robustez.

Em resumo

  • O pré-processamento prepara dados brutos para treino e inferência: limpeza, normalização, engenharia de features e exportação.
  • No Microsoft Foundry implementas pipelines como transforms reprodutíveis, ligados a OneLake e versionados para auditabilidade.
  • Evita discrepâncias entre treino e inferência aplicando exactamente as mesmas transformações; valida entradas e versiona código.
  • Pratica com o Practice Assessment oficial e a study guide da Microsoft e implementa labs reais no Foundry para consolidar.