Dos recipientes transparentes de formas distintas contienen líquido gris hasta alturas diferentes.

Cuando dos datos parecen comparables, pero no lo son

Un dashboard muestra que el 72 % de dos áreas cumple una expectativa. La igualdad desaparece cuando descubrimos que cada porcentaje fue construido con personas, periodos y fuentes diferentes.

PRYSMAP4 min de lectura

En un área se evaluó a toda la población durante seis meses; en la otra, solo a quienes completaron voluntariamente una autoevaluación durante las últimas cuatro semanas. Ambos porcentajes pueden ser aritméticamente correctos. No describen el mismo fenómeno.

La comparación necesita una relación de equivalencia que el formato visual suele dar por resuelta.

La definición cambia el objeto

Palabras iguales pueden ocultar reglas distintas. “Nivel avanzado” puede significar autonomía para resolver casos habituales en un equipo y, en otro, capacidad para definir estándares que afectan a varias áreas. Promediar o comparar resultados bajo una misma etiqueta no corrige esa diferencia.

Lo mismo ocurre cuando cambia el instrumento. Una puntuación proveniente de autoevaluación expresa una fuente y unas condiciones; una demostración práctica produce otra clase de evidencia. Incluso si ambas usan una escala de uno a cinco, el número no adquiere por eso el mismo significado.

La comparabilidad exige definiciones, clasificaciones y métodos suficientemente estables. El Código de buenas prácticas de las estadísticas europeas (se abre en una nueva pestaña) sitúa precisamente esos elementos en la base de estadísticas comparables a través de regiones, periodos y sectores. Trasladado a talento, el principio es sencillo: compartir formato no equivale a compartir objeto de medición.

El periodo puede explicar la diferencia aparente

Comparar este trimestre con el anterior parece natural, pero solo si ambos periodos representan condiciones suficientemente semejantes. Una reorganización, el ingreso masivo de personas, un cambio de expectativa o una campaña de evaluación pueden alterar quién participa y qué conducta resulta observable.

También importa la ventana utilizada. Un indicador construido con la última observación responde más rápido y es más sensible a episodios puntuales. Otro basado en seis meses suaviza variaciones y reacciona con demora. Ninguno es intrínsecamente mejor. Juntos requieren una advertencia: tienen distinta memoria.

La fecha de corte no es un detalle administrativo. Define qué realidad quedó dentro del dato.

La población decide a quién representa el resultado

Un 80 % puede corresponder a ocho de diez personas o a ochocientas de mil. El tamaño no invalida la proporción, pero cambia su estabilidad y el tipo de conclusión que soporta.

Más importante aún es la cobertura. ¿Se incluyó a todas las personas del rol, solo a quienes llevan más de seis meses, a quienes tuvieron observaciones recientes o a quienes respondieron? Si la exclusión se relaciona con aquello que queremos comprender, la cifra puede describir a la población visible y no a la población relevante.

Dos vasos de formas distintas contienen agua a diferentes alturas sobre una mesa iluminada.

El manual de calidad estadística de Naciones Unidas (se abre en una nueva pestaña) identifica la cobertura insuficiente o excesiva de la población objetivo y el desajuste del periodo de referencia como riesgos para la calidad. El paralelo organizacional no convierte una medición interna en estadística oficial, pero obliga a conservar la misma disciplina: declarar quién podía aparecer y quién quedó fuera.

El denominador contiene una decisión

Los porcentajes suelen esconder su base. “Brechas cerradas” puede dividir acciones completadas por acciones asignadas, personas reevaluadas por personas participantes o capacidades que alcanzaron la expectativa por capacidades priorizadas. El numerador se parece; la pregunta cambia con el denominador.

Por eso una comparación debería poder reconstruirse desde su fracción. Si no sabemos qué cuenta como caso posible, tampoco sabemos qué significa el resultado.

En el ejemplo inicial, el 72 % del área completa y el 72 % de participantes voluntarios no son versiones más o menos precisas de la misma cifra. Responden preguntas distintas. Una habla de cobertura bajo un proceso común; la otra describe respuestas dentro de un subconjunto autoseleccionado.

No toda diferencia debe corregirse

Objeto La definición y el instrumento usados.

Ventana El periodo y las condiciones observadas.

Cuando dos datos no son comparables, existen al menos tres salidas legítimas. Se pueden armonizar definiciones y volver a calcular. Se puede segmentar para comparar solo la porción equivalente. O se pueden mostrar por separado y explicar por qué responden preguntas diferentes.

Forzar una cifra única suele ser la peor opción porque borra el desacuerdo metodológico sin resolverlo. A veces la falta de comparabilidad es información: revela que dos áreas operan con expectativas distintas, que el proceso cambió o que todavía no existe una definición común.

Antes de interpretar una variación, hay que reconstruir cuatro decisiones: qué se definió, cuándo se observó, quién pudo entrar y cuál fue el denominador. El resultado de esa revisión puede ser una comparación armonizada, dos cifras presentadas por separado o la decisión de no compararlas. Las tres respuestas son más rigurosas que ordenar datos cuya equivalencia todavía no existe.