
Cómo diseñar una escala que reduzca diferencias de interpretación
Una escala reduce diferencias de interpretación cuando obliga a quienes evalúan a reconocer la misma evidencia, no cuando reemplaza palabras vagas por etiquetas más elegantes. Diseñarla exige definir qué se observa, hacer explícitas las fronteras entre niveles y probarlas con casos que expongan dónde comienza el desacuerdo.
El punto de partida no es decidir si habrá tres, cuatro o cinco niveles. Primero hay que precisar qué interpretación se hará del resultado y para qué se usará. Los Estándares para Pruebas Educativas y Psicológicas (se abre en una nueva pestaña), publicados conjuntamente por AERA, APA y NCME, insisten en vincular la validez con las interpretaciones y los usos previstos de los puntajes. La idea es especialmente importante cuando una escala influye en desarrollo, movilidad, selección o sucesión: el número solo tiene sentido dentro de una decisión definida.
Antes de redactar niveles, conviene dejar cuatro cosas por escrito:
- qué skill o dimensión se está evaluando;
- mediante qué conductas, decisiones, resultados, procedimientos o explicaciones puede manifestarse;
- bajo qué condiciones y con qué evidencia se hará la valoración;
- qué decisiones podrá apoyar el resultado y cuáles quedan fuera de su alcance.
Redactar manifestaciones, no impresiones
Una secuencia como básico, intermedio, avanzado y experto ordena etiquetas, pero todavía no ofrece criterios. Tampoco basta con añadir verbos imprecisos: conoce, aplica, domina e influye. Dos evaluadores pueden asignar significados muy distintos a cada uno y seguir convencidos de que aplicaron la escala correctamente.
Las escalas con anclas conductuales se desarrollaron precisamente para vincular los puntos de una escala con ejemplos específicos de desempeño. En el trabajo original de Patricia Cain Smith y Lorne Kendall (se abre en una nueva pestaña), los ejemplos eran aportados y luego reclasificados por personas familiarizadas con el trabajo, de modo que una conducta se conservara cuando otros podían reconocer a qué dimensión pertenecía. El principio sigue siendo útil, con una ampliación: en una skill no siempre se observa solo conducta. También pueden observarse la calidad de una decisión, el procedimiento seguido, el resultado pertinente o la explicación que permite reconstruir el razonamiento.
Esta especificación evita un error frecuente: construir una escala aparentemente clara para un objeto que sigue siendo ambiguo. Una ancla debería responder, en lo posible, a esta estructura:
manifestación observable + condiciones de ejecución + variable que distingue el nivel.
La variable puede ser autonomía, complejidad, alcance, consistencia o profundidad, siempre que esté definida y sea pertinente para esa skill. No conviene hacerlas crecer todas a la vez por inercia. Si un nivel cambia simultáneamente en autonomía, alcance e impacto, será difícil saber qué diferencia justificó la valoración.
Este ejemplo ilustrativo muestra una progresión posible para la dimensión tomar decisiones bajo incertidumbre:
| Nivel | Ancla de referencia |
|---|---|
| 1 | Con guía, identifica información faltante en situaciones conocidas y distingue lo observado de lo supuesto. |
| 2 | De forma autónoma, identifica información faltante en situaciones conocidas, explicita los supuestos y condiciona la decisión cuando la evidencia no alcanza. |
| 3 | En situaciones nuevas o complejas, define qué evidencia cambiaría la decisión, compara alternativas y hace explícito el riesgo residual. |
| 4 | Establece criterios reutilizables para decisiones de alto alcance, revisa su desempeño con evidencia posterior y ajusta el marco cuando cambian las condiciones. |
La tabla no pretende ser una escala universal ni demuestra por sí misma que la dimensión esté bien medida. Sirve para mostrar una disciplina de redacción: cada nivel contiene algo que podría examinarse y la progresión ocurre mediante diferencias identificables.
Diseñar las fronteras antes que los niveles aislados
Una escala suele redactarse de arriba hacia abajo: se imagina el desempeño más alto, después el más bajo y se rellenan los espacios intermedios. El resultado puede verse completo y, aun así, dejar dos niveles vecinos prácticamente indistinguibles.
Para cada par, hay que poder explicar qué evidencia ubica un caso a un lado y qué evidencia lo mueve al otro. Si esa diferencia solo puede expresarse con palabras como mayor, mejor, más sólido o consistentemente, todavía falta definir qué cambia de forma material.
Una revisión por pares adyacentes puede usar estas preguntas:
- ¿Qué manifestación aparece en el nivel superior que no se exige en el anterior?
- ¿La diferencia depende de una variable definida o de una impresión global?
- ¿Hay un caso razonable que cumpla parte de ambos niveles? ¿Cómo se resolvería?
- ¿La progresión supone acumulación? Si es así, ¿el nivel superior conserva de manera explícita lo anterior?
- ¿Alguna condición irrelevante, como antigüedad, visibilidad o elocuencia, se filtró en la descripción?
También hace falta una regla para la evidencia insuficiente. La ausencia de observaciones no debe empujar automáticamente a una persona hacia el nivel inferior. En ese caso el resultado es indeterminado: falta evidencia para valorar. Esta salida protege la interpretación de la escala y evita convertir desconocimiento en una brecha confirmada. La equidad también exige revisar si la persona contó con una oportunidad comparable de producir la evidencia.

Usar ejemplos que tensionen la escala
Un único ejemplo por nivel ayuda a imaginarlo, pero puede producir otro problema: que los evaluadores busquen una coincidencia literal con ese caso. Los ejemplos deben aclarar el criterio, no reemplazarlo.
Conviene preparar, al menos, tres tipos de casos:
Casos claros. Manifestaciones reconocibles de cada nivel en contextos distintos.
Casos limítrofes. Evidencia situada en la frontera entre dos niveles consecutivos.
Contraejemplos. Situaciones que se parecen al desempeño esperado, pero carecen de una condición decisiva. Los Estándares recomiendan usar respuestas ubicadas en las fronteras entre niveles adyacentes durante la formación de evaluadores, además de múltiples ejemplos por nivel. Aplicado a skills, esto significa discutir situaciones que obliguen a decidir si la evidencia muestra autonomía real, complejidad suficiente o consistencia, en lugar de trabajar solo con ejemplos obvios.
Los ejemplos también permiten detectar contaminación del criterio. Si todas las manifestaciones del nivel más alto incluyen exposición ejecutiva, por ejemplo, la escala podría estar premiando visibilidad aunque la skill evaluada no la requiera. Si todos los casos inferiores ocurren bajo presión y los superiores en condiciones favorables, el contexto está cargando una parte del resultado.
Pilotear el desacuerdo antes de publicar
La claridad de una escala no se valida leyendo sus descriptores en una reunión. Se prueba cuando varias personas valoran los mismos casos de manera independiente y después explican qué evidencia usaron.
El piloto puede ser pequeño, pero debe preservar esa independencia inicial. Si los evaluadores llegan primero a un consenso colectivo, será imposible distinguir si la escala era clara o si una persona convenció a las demás.
Después de la valoración, el desacuerdo se convierte en material de diseño. No todo desacuerdo tiene la misma causa:
- una palabra admite interpretaciones incompatibles;
- la frontera entre dos niveles está incompleta;
- el caso no ofrece evidencia suficiente;
- dos dimensiones fueron mezcladas dentro de la misma ancla;
- el contexto cambia legítimamente la interpretación;
- los evaluadores están usando estándares distintos que nunca se hicieron explícitos.
La solución depende del patrón. A veces hay que reescribir la ancla. En otras ocasiones falta un ejemplo, una regla de decisión o una condición de observación. También puede ocurrir que el desacuerdo revele que la escala intenta resolver con un solo puntaje una dimensión demasiado amplia.
La investigación sobre formación con marco de referencia aporta una pista adicional. Este tipo de entrenamiento busca que los evaluadores compartan estándares de desempeño y practiquen su aplicación sobre ejemplos comunes. Una revisión contemporánea de esta literatura (se abre en una nueva pestaña) reconoce el respaldo acumulado a su utilidad, pero también advierte que la exactitud no es una idea tan simple como comparar cada evaluación con un supuesto puntaje verdadero.
Mantener la escala después de su lanzamiento
Una escala puede funcionar bien durante el piloto y degradarse con el uso. Cambian los roles, aparecen situaciones que los ejemplos no cubren y los evaluadores desarrollan atajos propios. Por eso el diseño necesita una política de revisión.
Conviene observar qué niveles casi nunca se usan, dónde se concentra el desacuerdo, qué anclas requieren explicaciones adicionales y si grupos distintos aplican criterios diferentes ante evidencia comparable. También se pueden volver a calificar algunos casos de referencia para detectar desplazamientos en la interpretación. Si aparece una desviación sistemática, la respuesta puede incluir recalibración, nuevos ejemplos o una revisión de la escala.
Nada de esto convierte a las anclas conductuales en una garantía automática de calidad. Una revisión clásica de Rick Jacobs, Ditsa Kafry y Sheldon Zedeck (se abre en una nueva pestaña) concluyó que las escalas BARS no eran mejores ni peores que otros métodos en términos cuantitativos, aunque mostraban mayor potencial en criterios cualitativos y de uso. El formato ayuda a estructurar el juicio; la confiabilidad y la validez dependen del objeto, la evidencia, las personas que evalúan, el proceso y el uso previsto.
La comprobación final
Antes de aprobar una escala, debería ser posible responder afirmativamente estas preguntas:
- ¿Está definido qué se evalúa y qué decisión apoyará el resultado?
- ¿Cada ancla describe manifestaciones que pueden sostenerse con evidencia?
- ¿La frontera entre cada par de niveles adyacentes puede explicarse con precisión?
- ¿Existen ejemplos variados, contraejemplos y casos limítrofes?
- ¿La falta de evidencia tiene una salida distinta del nivel inferior?
- ¿Varias personas probaron la escala de forma independiente sobre los mismos casos?
- ¿Los desacuerdos fueron analizados por su causa y no solo resueltos por consenso?
- ¿Existe una regla para calibrar, monitorear y revisar la escala con el tiempo?
Reducir diferencias de interpretación no significa conseguir puntuaciones idénticas. Dos evaluadores pueden disponer de evidencia distinta o conocer contextos que cambian legítimamente la lectura. La meta es más exigente: que una diferencia pueda reconstruirse y discutirse a partir de criterios explícitos, en lugar de quedar escondida detrás de un número.





