Piezas metálicas de un mecanismo desmontado, dispuestas sobre fondo blanco.

Diez señales de una evaluación mal diseñada

Una evaluación mal diseñada suele revelar sus fallas antes de producir resultados. Las siguientes señales permiten detectarlas en el objeto, las preguntas, la evidencia, las escalas y el uso previsto, cuando todavía es posible corregir el diseño.

PRYSMAP5 min de lectura

No todas las fallas tienen el mismo efecto. Algunas reducen la consistencia entre evaluadores; otras debilitan la interpretación o vuelven injustificable una decisión. La corrección mínima propuesta aquí no convierte por sí sola una evaluación en válida. Sirve para detener un error reconocible y abrir la revisión que corresponde.

La herramienta de revisión

# Señal y síntoma Consecuencia probable Pregunta de validación Corrección mínima
1 La skill no tiene un objeto definido. Cada persona entiende algo distinto por liderazgo, análisis o comunicación. Las respuestas pueden ser consistentes internamente y aun referirse a fenómenos diferentes. ¿Qué decisiones, conductas, resultados o procedimientos cuentan como manifestaciones pertinentes? Escribir una definición operativa y excluir conceptos vecinos antes de redactar ítems.
2 La pregunta pide una impresión global. El evaluador responde si alguien tiene o no tiene la skill. Reputación, visibilidad y episodios recientes sustituyen evidencia específica. ¿La persona podría justificar su respuesta con situaciones observables del periodo? Preguntar por manifestaciones delimitadas y solicitar evidencia cuando el uso lo requiera.
3 Los niveles se distinguen solo por adjetivos. Básico, bueno y excelente no describen cambios reconocibles. Dos evaluadores asignan niveles distintos frente a la misma conducta. ¿Qué cambia realmente entre niveles: autonomía, complejidad, calidad, alcance o consistencia? Redactar anclas que muestren progresión en variables pertinentes.
4 Un ítem contiene varias capacidades. Planifica, comunica, ejecuta y mejora dentro de una sola afirmación. Una respuesta oculta perfiles distintos y no permite saber qué funcionó o falló. ¿Podrían dos componentes recibir valoraciones diferentes en la misma situación? Separar los componentes que apoyan inferencias y acciones distintas.
5 La fuente no tiene acceso a la evidencia. Se pregunta a un líder distante por conductas que casi nunca observa. La autoridad del rol se confunde con calidad de observación. ¿Qué interacción o evidencia concreta habilita a esta fuente para responder? Asignar fuentes según acceso y permitir declarar evidencia insuficiente.
6 No existe una opción legítima para no concluir. Toda respuesta debe convertirse en nivel. La ausencia de observación se registra como desempeño bajo o como estimación inventada. ¿Qué debe hacer el evaluador cuando no dispone de evidencia suficiente? Incorporar evidencia insuficiente como estado distinto de una brecha.
7 La escala mezcla frecuencia, calidad y dificultad. Un nivel alto puede significar hacerlo más veces, mejor o en contextos más complejos. El score pierde interpretabilidad porque combina progresiones incompatibles. ¿Qué variable ordena esta escala y cuáles funcionan solo como evidencia complementaria? Elegir una progresión dominante o separar dimensiones cuando la decisión lo necesite.
8 El periodo de observación es indeterminado. Se mezclan reputación histórica, incidentes recientes y expectativas futuras. El resultado no puede revisarse ni compararse con una referencia temporal clara. ¿Durante qué periodo y bajo qué condiciones se espera la evidencia? Definir ventana de observación y reglas para hechos excepcionales.
9 El uso apareció después del instrumento. La misma evaluación termina apoyando desarrollo, promoción, movilidad y compensación. Una interpretación diseñada para un propósito se extiende a consecuencias que no fueron validadas. ¿Qué decisión concreta fue definida antes del diseño y qué decisiones quedan fuera? Limitar el uso, documentarlo y reunir evidencia adicional antes de ampliarlo.
10 El resultado no puede reconstruirse. Se conserva el score, pero no las fuentes, reglas, contexto o evidencia. La conclusión carece de trazabilidad y es difícil corregir errores o explicar desacuerdos. ¿Podría una revisión posterior mostrar cómo se llegó a esta conclusión? Registrar versión, fuente, reglas aplicadas, periodo y evidencia pertinente con acceso controlado.

Cómo usar las señales

Objeto Definir qué manifestación se intenta evaluar.

Fuente Asignar evidencia según acceso pertinente.

Uso Limitar la interpretación a la decisión que fue diseñada.

Dos barras rectangulares, una blanca y otra negra con un extremo azul, sobre una mesa de madera.

El orden de revisión importa. Conviene empezar por el objeto y el uso, porque una escala muy bien redactada no rescata una evaluación que mide algo ambiguo o se aplica a una decisión para la que no fue diseñada. Después se revisan las fuentes y la evidencia. Finalmente se ajustan ítems, niveles y trazabilidad.

La guía de decisiones de evaluación de la U.S. Office of Personnel Management muestra que los benchmarks basados en competencias suelen incluir ejemplos conductuales específicos para distinguir niveles de dominio (OPM, 2007 (se abre en una nueva pestaña)). Su guía de entrevistas estructuradas también ilustra cómo las escalas se complementan con ejemplos conductuales para aclarar diferencias entre niveles (OPM, 2008 (se abre en una nueva pestaña)). Estos recursos no convierten cualquier conducta en una buena medida; muestran el trabajo de especificación que una escala necesita.

Los Standards for Educational and Psychological Testing llevan el criterio más lejos: cada interpretación de un score para un uso definido requiere evidencia de validez, y deben advertirse los usos no respaldados (AERA, APA y NCME, 2014 (se abre en una nueva pestaña)). Una evaluación puede ser consistente y todavía sostener una interpretación equivocada. Por eso confiabilidad, validez, trazabilidad y defendibilidad no son sinónimos.

Si varias señales aparecen a la vez, la respuesta no debería ser corregir frases una por una.

Es mejor volver a la decisión, al objeto y a la evidencia. La lista cumple su función cuando evita perfeccionar un instrumento cuya pregunta principal todavía no está clara. Si varias señales aparecen a la vez, la respuesta no debería ser corregir frases una por una.