
Como desenhar uma escala que reduza diferenças de interpretação
Uma escala reduz as diferenças de interpretação quando obriga os avaliadores a reconhecer as mesmas evidências, não quando substitui palavras vagas por rótulos mais elegantes. Projetá-la exige definir o que será observado, explicitar as fronteiras entre os níveis e testá-las com casos que revelem onde começa o desacordo.
O ponto de partida não é decidir se haverá três, quatro ou cinco níveis. Primeiro, é preciso definir que interpretação será feita do resultado e para que ele será usado. Os Padrões para Testes Educacionais e Psicológicos (abre em uma nova aba), publicados conjuntamente pela AERA, APA e NCME, insistem em vincular a validade às interpretações e usos pretendidos das pontuações. A ideia é especialmente importante quando uma escala influencia o desenvolvimento, a mobilidade, a seleção ou a sucessão: o número só faz sentido dentro de uma decisão definida.
Antes de redigir os níveis, convém registrar quatro pontos:
- qual skill ou dimensão está sendo avaliada;
- por meio de quais comportamentos, decisões, resultados, procedimentos ou explicações ela pode se manifestar;
- em que condições e com que evidências a avaliação será feita;
- quais decisões o resultado poderá apoiar e quais estão fora do seu alcance.
Redija manifestações, não impressões
Uma sequência como básico, intermediário, avançado e especialista organiza rótulos, mas ainda não oferece critérios. Também não basta acrescentar verbos imprecisos: conhecer, aplicar, dominar e influenciar. Dois avaliadores podem atribuir significados muito diferentes a cada um e ainda assim ficar convencidos de que aplicaram a escala corretamente.
Escalas com âncoras comportamentais foram desenvolvidas justamente para vincular pontos de uma escala a exemplos específicos de desempenho. No trabalho original de Patricia Cain Smith e Lorne Kendall (abre em uma nova aba), os exemplos foram fornecidos e depois reclassificados por pessoas familiarizadas com o trabalho, para que um comportamento fosse preservado quando outros pudessem reconhecer a qual dimensão ele pertencia. O princípio continua útil, com uma ampliação: em uma skill, nem sempre se observa apenas o comportamento. Também podem ser observados a qualidade de uma decisão, o procedimento seguido, o resultado relevante ou a explicação que permite reconstruir o raciocínio.
Esta especificação evita um erro comum: construir uma escala aparentemente clara para um objeto que permanece ambíguo. Uma âncora deve responder, se possível, a esta estrutura:
manifestação observável + condições de execução + variável que distingue o nível.
A variável pode ser autonomia, complexidade, abrangência, consistência ou profundidade, desde que definida e relevante para aquela skill. Não convém fazer todas essas variáveis crescerem ao mesmo tempo, por inércia. Se um nível mudar simultaneamente em autonomia, escopo e impacto, será difícil saber que diferença justificou a avaliação.
Este exemplo ilustrativo mostra uma possível progressão para a dimensão tomada de decisões sob incerteza:
| Nível | Âncora de referência |
|---|---|
| 1 | Com orientação, identifica informações faltantes em situações conhecidas e distingue o que é observado do que é pressuposto. |
| 2 | De forma autônoma, identifica informações faltantes em situações conhecidas, explicita os pressupostos e condiciona a decisão quando as evidências são insuficientes. |
| 3 | Em situações novas ou complexas, define quais evidências mudariam a decisão, compara alternativas e explicita o risco residual. |
| 4 | Estabelece critérios reutilizáveis para decisões de grande alcance, revê seu desempenho com evidências posteriores e ajusta o referencial quando as condições mudam. |
A tabela não pretende ser uma escala universal nem demonstra por si só que a dimensão é bem medida. Serve para mostrar uma disciplina de escrita: cada nível contém algo que pode ser examinado e a progressão ocorre por meio de diferenças identificáveis.
Projete fronteiras antes de níveis isolados
Uma escala geralmente é escrita de cima para baixo: imagine o desempenho mais alto, depois o mais baixo, e preencha os espaços intermediários. O resultado pode parecer completo e, ainda assim, deixar dois níveis vizinhos praticamente indistinguíveis.
Para cada par, deve ser possível explicar quais evidências colocam um caso de um lado e quais evidências o movem para o outro. Se essa diferença só puder ser expressa com palavras como maior, melhor, mais sólido ou consistentemente, ainda falta definir o que muda de forma concreta.
Uma revisão de níveis adjacentes pode usar estas perguntas:
- Que manifestação aparece no nível superior que não é exigida no nível anterior?
- A diferença depende de uma variável definida ou de uma impressão global?
- Existe algum caso razoável que atenda parte de ambos os níveis? Como isso seria resolvido?
- Progressão significa acumulação? Em caso afirmativo, o nível superior preserva explicitamente os requisitos anteriores?
- Alguma condição irrelevante, como antiguidade, visibilidade ou eloquência, vazou para a descrição?
Também é necessária uma regra para evidências insuficientes. A ausência de observações não deve empurrar automaticamente uma pessoa para um nível inferior. Nesse caso o resultado é indeterminado: não há evidências para avaliar. Esta saída protege a interpretação da escala e evita transformar a ignorância em uma lacuna confirmada. A equidade também exige verificar se a pessoa teve uma oportunidade comparável de produzir a evidência.

Use exemplos que coloquem a escala à prova
Um único exemplo por nível ajuda a imaginá-lo, mas pode causar outro problema: que os avaliadores procurem uma correspondência literal com aquele caso. Os exemplos devem esclarecer o critério e não substituí-lo.
Convém preparar pelo menos três tipos de casos:
Casos claros. Manifestações reconhecíveis de cada nível em diferentes contextos.
Casos limítrofes. Evidências localizadas na fronteira entre dois níveis consecutivos.
Contraexemplos. Situações que se assemelham ao desempenho esperado, mas carecem de condição decisiva. Os Padrões recomendam o uso de respostas localizadas em fronteiras entre níveis adjacentes durante o treinamento do avaliador, além de vários exemplos por nível. Aplicado às skills, isso significa discutir situações que obriguem a decidir se as evidências mostram autonomia real, complexidade ou consistência suficientes, em vez de trabalhar apenas com exemplos óbvios.
Os exemplos também permitem detectar a contaminação do critério. Se todas as manifestações do mais alto nível incluírem exposição executiva, por exemplo, a escala poderia recompensar a visibilidade, mesmo que a skill avaliada não a exija. Se todos os casos inferiores ocorrerem sob pressão e os casos superiores ocorrerem sob condições favoráveis, o contexto carrega uma parte do resultado.
Teste o desacordo antes de publicar
A clareza de uma escala não é validada pela leitura de seus descritores em uma reunião. Ela é testada quando várias pessoas avaliam independentemente os mesmos casos e depois explicam quais evidências usaram.
O piloto pode ser pequeno, mas deve preservar essa independência inicial. Se os avaliadores chegarem primeiro a um consenso coletivo, será impossível distinguir se a escala foi clara ou se uma pessoa convenceu as outras.
Após a avaliação, a discordância torna-se material de design. Nem todas as divergências têm a mesma causa:
- uma palavra admite interpretações incompatíveis;
- a fronteira entre dois níveis está incompleta;
- o caso não oferece evidências suficientes;
- duas dimensões foram misturadas na mesma âncora;
- o contexto altera legitimamente a interpretação;
- os avaliadores utilizam padrões diferentes que nunca foram explicitados.
A solução depende do padrão. Às vezes, é preciso reescrever a âncora. Outras vezes falta um exemplo, uma regra de decisão ou uma condição de observação. Pode também acontecer que a discordância revele que a escala tenta resolver uma dimensão ampla demais com uma única pontuação.
A pesquisa sobre treinamento em quadro de referência fornece uma pista adicional. Este tipo de treinamento busca que os avaliadores compartilhem padrões de desempenho e pratiquem sua aplicação em exemplos comuns. Uma revisão contemporânea desta literatura (abre em uma nova aba) reconhece o apoio acumulado para a sua utilidade, mas também alerta que a precisão não é uma ideia tão simples como comparar cada avaliação com uma pontuação supostamente verdadeira.
Mantenha a escala após o lançamento
Uma escala pode funcionar bem durante o piloto e se degradar com o uso. As funções mudam, surgem situações que os exemplos não cobrem e os avaliadores desenvolvem seus próprios atalhos. É por isso que o design precisa de uma política de revisão.
Convém observar quais níveis quase nunca são usados, onde se concentram as divergências, quais âncoras exigem explicações adicionais e se grupos diferentes aplicam critérios diferentes diante de evidências comparáveis. Alguns casos de referência também podem ser reavaliados para detectar mudanças na interpretação. Se aparecer um desvio sistemático, a resposta pode incluir uma recalibração, novos exemplos ou uma revisão da escala.
Nada disso faz das âncoras comportamentais garantia automática de qualidade. Uma revisão clássica de Rick Jacobs, Ditsa Kafry e Sheldon Zedeck (abre em uma nova aba) concluiu que as escalas BARS não eram nem melhores nem piores que outros métodos em termos quantitativos, embora apresentassem maior potencial em critérios qualitativos e de uso. O formato ajuda a estruturar o julgamento; a confiabilidade e a validade dependem do objeto, da evidência, das pessoas que o avaliam, do processo e do uso pretendido.
A conferência final
Antes de aprovar uma escala, deve ser possível responder afirmativamente a estas questões:
- Está definido o que será avaliado e qual decisão apoiará o resultado?
- Cada âncora descreve manifestações que podem ser apoiadas por evidências?
- A fronteira entre cada par de níveis adjacentes pode ser explicada com precisão?
- Existem exemplos variados, contra-exemplos e casos limítrofes?
- A falta de evidências tem um resultado diferente do nível inferior?
- Várias pessoas testaram a escala de forma independente nos mesmos casos?
- As divergências foram analisadas pela sua causa e não apenas resolvidas por consenso?
- Existe uma regra para calibrar, monitorar e revisar a escala ao longo do tempo?
Reduzir as diferenças de interpretação não significa chegar a pontuações idênticas. Dois avaliadores podem ter evidências diferentes ou conhecer contextos que alterem legitimamente a leitura. O objetivo é mais exigente: que uma diferença possa ser reconstruída e discutida com base em critérios explícitos, em vez de ficar escondida atrás de um número.





