
Dez sinais de uma avaliação mal concebida
Uma avaliação mal concebida costuma revelar suas falhas antes de produzir resultados. Os sinais a seguir permitem detectá-las no objeto, nas perguntas, nas evidências, nas escalas e no uso previsto, enquanto ainda é possível corrigir o desenho.
Nem todas as falhas têm o mesmo efeito. Algumas reduzem a consistência entre avaliadores; outras enfraquecem a interpretação ou tornam uma decisão indefensável. A correção mínima proposta aqui não torna uma avaliação válida por si só. Serve para interromper um erro reconhecível e iniciar a revisão correspondente.
A ferramenta de revisão
| # | Sinal e sintoma | Consequência provável | Pergunta de validação | Correção mínima |
|---|---|---|---|---|
| 1 | A skill não tem um objeto definido. Cada pessoa entende algo diferente por liderança, análise ou comunicação. | As respostas podem ser internamente consistentes e ainda se referir a fenômenos diferentes. | Quais decisões, comportamentos, resultados ou procedimentos contam como manifestações pertinentes? | Escrever uma definição operacional e excluir conceitos vizinhos antes de redigir os itens. |
| 2 | A pergunta solicita uma impressão global. O avaliador responde se alguém tem ou não tem a skill. | Reputação, visibilidade e episódios recentes substituem evidências específicas. | A pessoa poderia justificar sua resposta com situações observáveis do período? | Perguntar por manifestações delimitadas e solicitar evidências quando o uso exigir. |
| 3 | Os níveis se distinguem apenas por adjetivos. Básico, bom e excelente não descrevem mudanças reconhecíveis. | Dois avaliadores atribuem níveis diferentes diante do mesmo comportamento. | O que realmente muda entre os níveis: autonomia, complexidade, qualidade, alcance ou consistência? | Redigir âncoras que mostrem progressão em variáveis pertinentes. |
| 4 | Um item contém várias capacidades. Planeja, comunica, executa e melhora dentro de uma única afirmação. | Uma resposta oculta perfis diferentes e não permite saber o que funcionou ou falhou. | Dois componentes poderiam receber avaliações diferentes na mesma situação? | Separar os componentes que sustentam inferências e ações distintas. |
| 5 | A fonte não tem acesso às evidências. Pergunta-se a uma liderança distante sobre comportamentos que quase nunca observa. | A autoridade da função é confundida com a qualidade da observação. | Qual interação ou evidência concreta permite que esta fonte responda? | Atribuir fontes conforme o acesso e permitir declarar evidência insuficiente. |
| 6 | Não existe uma opção legítima para não concluir. Toda resposta deve se transformar em nível. | A ausência de observação é registrada como baixo desempenho ou como estimativa inventada. | O que o avaliador deve fazer quando não dispõe de evidências suficientes? | Incorporar evidência insuficiente como estado distinto de uma lacuna. |
| 7 | A escala mistura frequência, qualidade e dificuldade. Um nível alto pode significar fazer mais vezes, melhor ou em contextos mais complexos. | O score perde interpretabilidade porque combina progressões incompatíveis. | Qual variável ordena esta escala e quais funcionam apenas como evidências complementares? | Escolher uma progressão dominante ou separar dimensões quando a decisão exigir. |
| 8 | O período de observação é indeterminado. Misturam-se reputação histórica, incidentes recentes e expectativas futuras. | O resultado não pode ser revisado nem comparado com uma referência temporal clara. | Durante qual período e sob quais condições se esperam as evidências? | Definir uma janela de observação e regras para acontecimentos excepcionais. |
| 9 | O uso surgiu depois do instrumento. A mesma avaliação acaba apoiando desenvolvimento, promoção, mobilidade e remuneração. | Uma interpretação desenhada para uma finalidade se estende a consequências para as quais não foi validada. | Qual decisão concreta foi definida antes do desenho e quais decisões ficam de fora? | Limitar o uso, documentá-lo e reunir evidências adicionais antes de ampliá-lo. |
| 10 | O resultado não pode ser reconstruído. Conserva-se o score, mas não as fontes, regras, contexto ou evidências. | A conclusão não tem rastreabilidade, dificultando a correção de erros e a explicação de divergências. | Uma revisão posterior poderia mostrar como se chegou a esta conclusão? | Registrar versão, fonte, regras aplicadas, período e evidências pertinentes com acesso controlado. |
Como usar os sinais
Objeto Definir qual manifestação se procura avaliar.
Fonte Atribuir evidências de acordo com o acesso pertinente.
Uso Limitar a interpretação à decisão para a qual foi desenhada.

A ordem de revisão importa. Convém começar pelo objeto e pelo uso, porque uma escala muito bem redigida não salva uma avaliação que mede algo ambíguo ou é aplicada a uma decisão para a qual não foi desenhada. Depois, revisam-se as fontes e as evidências. Por fim, ajustam-se itens, níveis e rastreabilidade.
O guia de decisões de avaliação do U.S. Office of Personnel Management mostra que benchmarks baseados em competências costumam incluir exemplos comportamentais específicos para distinguir níveis de domínio (OPM, 2007 (abre em uma nova aba)). Seu guia de entrevistas estruturadas também ilustra como as escalas são complementadas com exemplos comportamentais para esclarecer diferenças entre níveis (OPM, 2008 (abre em uma nova aba)). Esses recursos não transformam qualquer comportamento em uma boa medida; mostram o trabalho de especificação de que uma escala precisa.
Os Standards for Educational and Psychological Testing levam o critério mais longe: cada interpretação de um score para um uso definido exige evidências de validade, e é preciso alertar para os usos que não têm sustentação (AERA, APA e NCME, 2014 (abre em uma nova aba)). Uma avaliação pode ser consistente e ainda sustentar uma interpretação equivocada. Por isso, confiabilidade, validade, rastreabilidade e defensibilidade não são sinônimos.
Quando vários sinais aparecem ao mesmo tempo
É melhor voltar à decisão, ao objeto e às evidências. A lista cumpre sua função quando impede o aperfeiçoamento de um instrumento cuja pergunta principal ainda não está clara.





