(+351) 21 24 10006  ·  info@bconcepts.pt
Carnaxide, Lisboa

Cómo generar Data Quality Rules en Copilot en Fabric

João Barros 08 de September de 2026 4 min de lectura

Este tutorial muestra cómo generar reglas de Data Quality en Copilot de Fabric para validar columnas, detectar valores nulos e identificar outliers. Es útil para automatizar comprobaciones de calidad antes de publicar datos en un Lakehouse o Warehouse.

Requisitos previos

  • Cuenta con acceso a Microsoft Fabric y permisos para abrir un Notebook o un Dataflow Gen2.
  • Dataset de ejemplo cargado en OneLake o en el Lakehouse (CSV o tabla).
  • Conocimientos básicos de SQL o Python (nivel intermedio mínimo).

Paso 1: Abrir el Copilot en el contexto del dataset

Abre el archivo del dataset en Fabric (por ejemplo, en un Notebook o Dataflow Gen2). Selecciona la vista donde estás viendo las columnas. A continuación, abre el panel del Copilot para que las sugerencias se basen en el contexto del archivo abierto. Esto permite a Copilot analizar nombres de columnas y tipos.

Paso 2: Pedir un inventario de columnas y problemas comunes

Solicita a Copilot un inventario sencillo de las columnas con sugerencias de qué comprobaciones hacer (nulos, unicidad, formato). Pide un ejemplo de reglas en lenguaje natural y en SQL/Python.

Prompt exemplo:
"Lista as colunas desta tabela e sugere 5 regras de Data Quality (nulos, unicidade, range, formato, outliers). Mostra regras em SQL e em Python pandas."

Paso 3: Generar reglas en SQL para ejecutar en el Warehouse

Con la salida de Copilot, copia las reglas SQL generadas y adapta los nombres reales de las tablas/columnas. Las reglas típicas son conteos de nulos, porcentaje de valores únicos, checks de formato con LIKE/REGEXP y outliers con percentiles.

Exemplo SQL (ajusta table_name/column):
-- 1. Percentagem de nulos
SELECT
  COUNT(*) AS total_rows,
  SUM(CASE WHEN column IS NULL THEN 1 ELSE 0 END) AS null_count,
  SUM(CASE WHEN column IS NULL THEN 1 ELSE 0 END)*1.0/COUNT(*) AS null_pct
FROM table_name;

-- 2. Verifica unicidade
SELECT COUNT(*) AS total_rows, COUNT(DISTINCT column) AS distinct_count
FROM table_name;

-- 3. Formato (ex.: email)
SELECT COUNT(*) AS invalid_emails
FROM table_name
WHERE column NOT LIKE '%_@__%.__%';

-- 4. Outliers (valores fora dos percentis 1% e 99%)
WITH pct AS (
  SELECT
    approx_percentile(column, 0.01) AS p01,
    approx_percentile(column, 0.99) AS p99
  FROM table_name
)
SELECT * FROM table_name, pct
WHERE column < p01 OR column > p99;

Paso 4: Generar checks automáticos en Python (pandas) para prototipado

Si prefieres prototipar localmente o en un Notebook, pide a Copilot el código pandas correspondiente. Esto ayuda a validar rápidamente antes de llevarlo al Warehouse o Dataflow.

Exemplo Python (pandas):
import pandas as pd

df = pd.read_csv('table_name.csv')  # ou carregar do OneLake
# 1. Percentagem de nulos
null_pct = df['column'].isna().mean()
# 2. Unicidade
distinct_count = df['column'].nunique()
# 3. Formato simples (email)
invalid_emails = df[~df['column'].str.contains(r".+@.+\..+", na=False)]
# 4. Outliers (1% / 99%)
low = df['column'].quantile(0.01)
high = df['column'].quantile(0.99)
outliers = df[(df['column'] < low) | (df['column'] > high)]

print(null_pct, distinct_count, len(invalid_emails), len(outliers))

Paso 5: Convertir reglas en checks reutilizables (Template de Prompt)

Crea un prompt estándar para Copilot que contenga el patrón de las comprobaciones y parámetros (umbrales de aceptación). Así, puedes reutilizarlo para otras tablas cambiando solo el nombre y los umbrales.

Prompt template exemplo:
"Gera um conjunto de checks de Data Quality para a tabela {table_name}. Inclui: percentagem de nulos por coluna, verificação de unicidade para chaves, formatos para colunas 'email' e 'date', e deteção de outliers com limiar 1%/99%. Devolve código SQL e Python."

Verificar el resultado

Ejecuta los scripts SQL en el Warehouse o el código Python en el Notebook y confirma los retornos: porcentajes de nulos aceptables, conteo de valores inválidos y lista de outliers. Si los valores exceden los umbrales, márcalos como fallo. Errores comunes: nombres de columnas distintos, tipos incorrectos (string vs numeric) y funciones SQL soportadas por el engine del Warehouse — ajusta según sea necesario.

Conclusión

Usando Copilot en Fabric puedes generar rápidamente reglas de Data Quality en SQL y Python para validar tablas antes de la publicación. Próximos pasos: integrar estas checks en un Dataflow Gen2 o programarlas en el Warehouse para monitorización continua. Consejo: mantén un prompt template con umbrales para acelerar auditorías; ¿qué regla te gustaría automatizar primero?