Em janeiro de 2026, a Fortune descreveu, a partir de documentos internos obtidos pelo Business Insider, a nova avaliação de desempenho da Meta: quatro categorias, com cerca de 20% das pessoas em "Outstanding", 70% em "Excellent", 7% em "Needs Improvement" e 3% em "Not Meeting Expectations". Repare na segunda: quando a regra prevê sete em cada dez pessoas em "excelente", a palavra deixa de descrever o trabalho e passa a descrever uma cota. Uma escala de avaliação de desempenho escrita só com adjetivos não resiste a isso, porque nada nela diz o que "excelente" exige. Por esse motivo, este texto trata de outra coisa: o que está escrito dentro de cada nota.
Quantos pontos tem a escala de avaliação das empresas que dão nota
Organizações que avaliam desempenho com nota, por tamanho da escala · 2026 Performance Management Report, Talent Strategy Group
- 56,9% · 5 pontos
- 20% · 4 pontos
- 16,2% · 3 pontos
- 6,9% · 6 ou mais
A pergunta que esse tipo de levantamento faz é quantos pontos a escala tem. A que decide se a nota vale alguma coisa é outra, e nenhum dos quatro números responde: o que precisa ter acontecido no semestre para alguém receber um 3?
A resposta a essa pergunta tem nome: âncora. É a frase que acompanha cada ponto da escala e descreve o comportamento que vale aquele número. Este texto entrega um verificador de âncoras que roda no navegador com as suas frases, as sete regras que ele aplica, a oficina para escrever as âncoras a partir de episódios reais, uma escala reescrita inteira, um teste com duas pessoas e a conta que ele produz, e como escolher o número de pontos. Antes de tudo isso, uma ressalva que a pesquisa impõe: âncora boa não conserta avaliador. Ela faz outra coisa, e vale a pena saber qual.
O que é uma âncora e quais são os tipos de escala
Toda escala de avaliação de desempenho tem duas partes: os pontos (1 a 5, 1 a 4, "abaixo / dentro / acima") e o texto que diz o que cada ponto significa. Os tipos de escala se diferenciam pelo texto, não pelos pontos.
| Tipo | O que cada ponto contém | Exemplo do ponto 3 | Onde quebra |
|---|---|---|---|
| Escala gráfica | Um número e, no máximo, um adjetivo | "3 — Bom" | Cada avaliador decide sozinho o que é "bom" |
| Escala de expectativas | Uma posição relativa a um padrão | "3 — Atende às expectativas" | O padrão não está escrito em lugar nenhum |
| Ancorada em comportamento (BARS) | Uma frase que descreve o que a pessoa fez naquele nível | "Avisa mudança de prazo em até 2 dias úteis, por escrito" | Dá trabalho escrever e vale só para o comportamento descrito |
| De observação comportamental (BOS) | Com que frequência um comportamento apareceu | "Avisou a mudança de prazo em cerca de metade das entregas" | Vira "às vezes / frequentemente" se a frequência não tiver número |
A sigla BARS vem de behaviorally anchored rating scales — escalas ancoradas em comportamento — e o método nasceu num artigo de Patricia Cain Smith e Lorne Kendall de 1963 cujo título já diz o que ele buscava: "âncoras não ambíguas". A técnica deles, a retradução, é a base da oficina deste texto. A maior parte das escalas que circulam nas empresas é das duas primeiras linhas da tabela; a nota 3 do verificador, logo adiante, é um caso de manual da segunda.
O que a pesquisa mede: o formato importa menos do que quem avalia
Seria confortável dizer que escala ancorada resolve o problema da nota injusta. A pesquisa não deixa. Os estudos que compararam formatos nos anos 1970 chegaram a uma conclusão parecida:
- Borman e Dunnette (1975) compararam formatos com 23 oficiais da Marinha americana no papel de avaliadores. A escala ancorada saiu um pouco melhor em três de quatro medidas (leniência, efeito halo, concordância entre avaliadores, capacidade de diferenciar pessoas), mas a diferença devida ao formato não passou de 5% da variância em nenhum caso.
- Jacobs, Kafry e Zedeck (1980), numa revisão da literatura, concluíram que a BARS "não é melhor nem pior que outros métodos quando avaliada quantitativamente", mas tem "maior potencial quando avaliada pelos critérios de uso e qualitativos".
- Kingstrom e Bass (1981), em outra revisão, encontraram que a BARS e os outros formatos "diferem relativamente pouco (se é que diferem)" em leniência, halo, concordância, discriminação e validade — e que os problemas de método dos estudos tornavam "bastante frágeis" as conclusões sobre superioridade.
O motivo aparece quando se mede de onde vem a variação de uma nota. No estudo de Scullen, Mount e Goff (2000), com dois grupos de 2.350 e 2.142 gestores avaliados por sete pessoas cada, a maior fatia da variância das notas era do avaliador — 62% e 53%, nos dois grupos —, e só 21% e 25% eram do desempenho de quem estava sendo avaliado. O texto sobre avaliação 360 graus usa esse mesmo estudo para decidir quantos avaliadores pedir. Aqui ele serve para outra conta: se o formato inteiro mexeu em no máximo 5% da variância no estudo de Borman e Dunnette, não é a redação de uma âncora que vai apagar os 53% a 62% que moram em quem dá a nota.
Então por que escrever âncoras? Porque a frase de Jacobs, Kafry e Zedeck aponta para onde o ganho está — o uso. Uma âncora escrita é o que torna possível três coisas que uma escala de adjetivos não permite: treinar avaliadores com casos antes do ciclo (o teste das duas pessoas, mais adiante, é o começo desse treino); discutir uma nota numa reunião de calibração apontando para uma frase, e não para a impressão de cada um; e dizer à pessoa avaliada o que mudaria a nota dela — o que pesa mais quando a nota vira dinheiro, como num ciclo de aumento por mérito. É esse terceiro uso que a pesquisa do Gartner sugere estar faltando. Numa pesquisa do Gartner com 2.947 funcionários e gestores, feita em novembro e dezembro de 2025 e divulgada em 2026, só 39% dos funcionários concordaram que o gestor é eficaz em dar feedback claro de desenvolvimento. Uma nota ancorada já traz, escrita, a diferença entre o nível em que a pessoa está e o seguinte.
A leitura deste texto, e não das fontes: âncora boa reduz pouco o erro de quem avalia e aumenta muito o que se consegue fazer com a nota depois. Os estudos acima medem o primeiro efeito; nenhum deles mede o segundo, que é argumento, não achado.
Verificador de âncoras: cole a sua escala e veja o que ele aponta
Agora a ferramenta. O verificador abaixo lê as cinco frases de uma escala de 1 a 5 e aplica sete regras de redação, uma por vez. Ele não entende o seu negócio e não sabe se a frase está certa: sabe reconhecer as formas de escrever que deixam cada avaliador ler um número diferente. Os campos já vêm com uma escala de comunicação escrita numa forma comum — e o resultado dela está logo abaixo dos campos, calculado com as mesmas regras que rodam quando você digita.
Verificador de âncoras · escala de 1 a 5
Troque o texto de qualquer nível; o resultado se refaz enquanto você escreve. Nada sai do seu navegador.
0 de 5 níveis passam sem defeito.
Nota 1 3 defeitos
- Julga em vez de descrever: “fraca”.
- Frequência sem número: “raramente”.
- Curta demais: 7 palavras; não cabe uma situação.
- Sem situação verificável: nenhum número, prazo ou condição (“quando”, “antes”, “sem”).
Nota 2 2 defeitos
- Frequência sem número: “às vezes”.
- Aponta para outra nota: “esperado”, “abaixo do”.
- Sem situação verificável: nenhum número, prazo ou condição (“quando”, “antes”, “sem”).
Nota 3 1 defeito
- Aponta para outra nota: “expectativas”.
- Sem situação verificável: nenhum número, prazo ou condição (“quando”, “antes”, “sem”).
Nota 4 1 defeito
- Traço de personalidade: “comunicativo”.
- Sem situação verificável: nenhum número, prazo ou condição (“quando”, “antes”, “sem”).
Nota 5 2 defeitos
- Traço de personalidade: “comunicativo”.
- Igual à nota 4, mudando só a intensidade: o que muda: “muito”, “todas”.
- Sem situação verificável: nenhum número, prazo ou condição (“quando”, “antes”, “sem”).
Defeito é o que faz dois avaliadores discordarem; aviso é o que costuma fazer, mas às vezes é intencional. Exemplos das palavras que disparam cada regra estão na próxima seção. O verificador procura palavras e comparações entre níveis vizinhos, e por isso erra às vezes para os dois lados — "sem dúvida" conta como condição, e um adjetivo que não esteja nas listas passa: uma escala que passa limpa ainda precisa do teste com duas pessoas, mais adiante.
A escala de exemplo não é uma caricatura. É a forma que a maioria dos formulários de avaliação de desempenho assume quando alguém precisa preencher cinco caixas numa tarde: um adjetivo para a nota baixa, "atende às expectativas" no meio e a nota alta igual à anterior com um "muito" a mais. Zero de cinco níveis passam. E repare no que a nota 3 diz de verdade: ela manda o avaliador procurar a resposta num lugar que não está escrito em lugar nenhum — as expectativas.
As sete regras de uma âncora que funciona
Cada regra abaixo é uma das checagens do verificador, com a lista de palavras que a dispara, o motivo e um par de antes e depois. As quatro primeiras são sobre palavras; a quinta compara dois níveis; a sexta e a sétima são sobre o tamanho e a matéria da frase.
1. Descreva o que aconteceu, não o julgamento
"Fraca", "boa", "satisfatória", "excelente", "adequada", "razoável", "exemplar". Um adjetivo de julgamento é a conclusão que a escala deveria ajudar o avaliador a tirar — escrito dentro dela, ele devolve a pergunta para quem perguntou. "A comunicação dela foi boa?" é exatamente o que o formulário estava perguntando.
AntesComunicação fraca com o time.
DepoisEm 2 ou mais entregas do semestre, o time soube de mudança de prazo ou de escopo pela data vencida ou por outra área, sem aviso da pessoa.
2. Frequência tem número
"Às vezes", "frequentemente", "raramente", "geralmente", "quase sempre", "sempre", "nunca". Palavras de frequência parecem precisas e não são: num estudo alemão de 2012 (Bocklisch e colegas, com 89 e 109 participantes), as pessoas traduziram onze expressões desse tipo em números, e as faixas de cada palavra variaram muito em largura e se sobrepuseram — as palavras não ficam igualmente espaçadas na escala numérica. Numa amostra nacional dos EUA com 1.172 pessoas (Schaeffer, 1991), expressões desse tipo significaram frequências maiores para os mais jovens, os mais escolarizados e os brancos. Ou seja: "frequentemente" é um número diferente para cada avaliador, e a diferença depende de quem avalia. Quando a âncora precisa falar de frequência, escreva a contagem e o período: "em 2 das 6 entregas do semestre".
AntesFrequentemente entrega no prazo.
DepoisEntregou no prazo combinado pelo menos 5 das 6 entregas do semestre; a que atrasou foi avisada antes da data.
"Sempre" e "nunca" entram na mesma lista por outro motivo: são absolutos que quase nenhum semestre real confirma. Quem avalia encontra a única exceção, desiste do nível e sobe ou desce um ponto por conta própria.
3. Comportamento, não personalidade
"Proativo", "comprometido", "engajado", "comunicativo", "maduro", "atitude", "postura". Traço é uma hipótese sobre quem a pessoa é, construída a partir do que ela fez — e cada avaliador constrói a sua com episódios diferentes. A âncora deve ficar no nível do episódio, que é o que dois avaliadores podem conferir juntos. E há um custo de conversa: a pessoa avaliada consegue mudar o que fez no próximo semestre; ouvir que "falta proatividade" não diz o que fazer na segunda-feira.
AntesÉ proativa na resolução de problemas.
DepoisQuando encontra um problema fora do escopo dela, abre o chamado ou avisa o dono no mesmo dia, com o que já testou.
4. Cada nível se sustenta sozinho
"Atende às expectativas", "acima do esperado", "abaixo da média", "supera", "além do nível 4". São âncoras que apontam para outra âncora — ou para um padrão que não está escrito. "Atende às expectativas" é uma frase frequente no meio de uma escala de cinco pontos e é também a que menos informa: ela só funciona se as expectativas estiverem escritas em outro lugar, e aí o lugar certo para elas é a própria âncora. A regra vale também para a escala melhorada: uma nota 5 que comece com "além do nível 4" é pega pelo verificador, porque aponta para a nota de baixo em vez de descrever o trabalho.
AntesAtende às expectativas de comunicação com o time.
DepoisAvisa mudança de prazo ou de escopo em até 2 dias úteis, por escrito; no máximo 1 entrega do semestre teve aviso atrasado, puxado por pergunta ou ausente.
5. O nível de cima não é o de baixo com "muito"
O verificador compara cada nota com a anterior, tira as palavras de ligação e olha o que sobra de diferença. Se tudo o que muda é "muito", "bem", "todas", "mais", "não" ou um quantificador de frequência, a nota de cima é a nota de baixo com o volume aumentado. Duas notas escritas assim obrigam o avaliador a decidir sozinho onde termina "bem informado" e começa "muito bem informado" — que é a decisão que a escala existia para tomar por ele.
AntesNota 4: mantém o time bem informado sobre as entregas. Nota 5: mantém o time muito bem informado sobre todas as entregas.
DepoisNota 4: avisa em até 1 dia útil, com o novo plano. Nota 5: avisa o risco antes de a mudança acontecer, com duas saídas e o custo de cada uma.
Repare na diferença entre os dois níveis do "depois": a nota 5 não é "avisar mais rápido", é um comportamento diferente — antecipar em vez de reagir. Níveis que mudam de natureza são mais fáceis de separar do que níveis que mudam de grau.
6. Entre oito e quarenta palavras
Menos de oito palavras cabe um adjetivo e um substantivo, não uma situação. Mais de quarenta vira parágrafo, e parágrafo ninguém relê na décima quinta avaliação da semana — por isso o verificador trata o excesso como aviso, e a falta como defeito. Os dois limites são uma regra deste texto, não da literatura: servem para forçar uma frase por nível, com um episódio dentro.
7. Alguma coisa nela se confere no calendário
A sétima checagem é um aviso, não um defeito: ela procura na frase um número, um prazo ou uma condição ("quando", "antes", "depois", "sem", "até"). Âncora sem nada disso ainda pode ser boa — "explica a decisão para o time e registra no canal da área" é concreta sem número nenhum. Mas uma escala inteira sem uma única contagem é, quase sempre, uma escala que nenhum avaliador consegue conferir contra o semestre que acabou.
O que o verificador não faz. Ele não sabe se a nota 4 é de fato melhor que a nota 3 no seu contexto, nem se o comportamento descrito importa para o cargo. Ordem e relevância são decisões de quem conhece o trabalho — é por isso que a oficina da seção seguinte começa pedindo episódios reais, e não palavras melhores.
Diagnóstico · 90 segundos
Onde a sua gestão de desempenho está hoje?
O diagnóstico gratuito da Spire pergunta, entre oito questões, como a avaliação funciona aí — as respostas vão de "não existe" a "ciclos definidos, com feedback de várias fontes" — e completa o retrato com metas, desenvolvimento e clima. Responder toma um minuto e meio. Para ver a nota por área, o último passo pede quatro campos obrigatórios: como você se chama, o e-mail do trabalho, o porte da empresa em pessoas e a sua função.
A oficina: como escrever as âncoras a partir de episódios reais
O verificador pega a redação ruim; ele não inventa a boa. A âncora boa sai de episódios que aconteceram, e o método para chegar a ela é o de Smith e Kendall, adaptado a uma empresa que não tem um departamento de psicometria. Um relatório técnico do ETS de 2018 (Klieger e colegas) descreve a versão moderna: cerca de 430 episódios coletados com gestores viraram 398 frases, que 65 gestores reclassificaram às cegas; ficaram as que pelo menos metade pôs na mesma categoria e que não tinham notas espalhadas demais. A versão abaixo cabe numa tarde de duas horas e meia, com seis gestores que avaliam o mesmo tipo de cargo (com cinco, uma pessoa acumula duas funções no passo 3), mais o tempo de alguém preparar, antes, os dez casos do passo 4.
-
Episódios · 30 minutos · cada gestor sozinho
A oficina trabalha três tópicos de uma vez — por exemplo, comunicação com o time, qualidade da entrega e colaboração entre áreas. Para cada tópico, cada gestor escreve seis episódios reais dos últimos dois ciclos: dois de trabalho muito bom, dois comuns, dois ruins. Um episódio é uma cena com verbo no passado — "avisou o cliente interno três dias antes que a integração ia atrasar e mandou duas datas alternativas" —, nunca um traço. Com seis pessoas, saem 108 episódios, 36 por tópico.
-
Retradução · 60 minutos · às cegas
Os episódios dos três tópicos são embaralhados juntos, sem autor, sem tópico e sem a nota que o autor imaginou — e o voto de quem escreveu cada episódio não entra na conta dele, porque o autor reconhece o próprio texto. Cada gestor diz, para cada episódio, a qual tópico ele pertence e que nota de 1 a 5 ele vale. Fica o episódio que pelo menos metade das pessoas pôs no mesmo tópico e cujas notas tiveram desvio-padrão de até 1,0. O primeiro corte é o do relatório do ETS (50% na mesma categoria). O segundo adapta a regra de bolso que o relatório cita — desvio de até 1,5 numa escala de 7 pontos — à escala de 5, na proporção da amplitude: 1,5 × 4 ÷ 6 = 1,0. No relatório do ETS, o critério de dispersão descartou 48 das 398 frases, 12%. Episódio que troca de tópico na mão de outra pessoa é ambíguo sobre o que mede; episódio com notas espalhadas é ambíguo sobre quanto vale.
-
Redação · 40 minutos · uma dupla por tópico
Para cada tópico e cada nota de 1 a 5, a dupla junta os episódios que sobreviveram naquele nível e escreve uma frase que os descreve — o comportamento comum a eles, com a contagem e o prazo que os episódios mostram. Onde um nível ficou sem episódio (costuma ser o 2 ou o 4), a dupla escreve uma frase intermediária entre as vizinhas e marca para testar. Depois roda as cinco frases no verificador e corrige até nenhum defeito sobrar.
-
Teste · 20 minutos · duas pessoas de fora
Duas pessoas que não escreveram a escala avaliam dez casos com ela, e a dupla faz as contas descritas em "O teste das duas pessoas". Âncora que produziu discordância volta para o passo 3, com os casos da discordância na mesa.
O corte do passo 2 é o que dá nome ao método: um episódio que o autor achou "muito bom" e metade da sala achou "comum" não serve de âncora para nenhum dos dois níveis — e descobrir isso antes do ciclo custa uma hora; descobrir no comitê de calibração custa uma nota contestada por pessoa.
Uma escala reescrita inteira: comunicação com o time
Aplicadas juntas, as sete regras transformam a escala do verificador nesta. O tópico é o mesmo — comunicação com o time —, mas o objeto ficou mais estreito: como a pessoa avisa mudança de prazo e de escopo. Estreitar é parte da técnica. "Comunicação" inteira não cabe em cinco frases; o comportamento que mais dói quando falta, sim.
- 1
Em 2 ou mais entregas do semestre, o time soube de mudança de prazo ou de escopo pela data vencida ou por outra área, sem aviso da pessoa.
O pior caso descrito pelo que o time viveu, não pelo que a pessoa é.
- 2
Em 2 ou mais entregas do semestre, o aviso de mudança de prazo ou de escopo veio puxado por pergunta, depois de 2 dias úteis, depois da data ou não veio.
Aviso puxado, lento ou ausente em mais de uma entrega; o 1 é quando ninguém avisa, duas vezes ou mais.
- 3
Avisa mudança de prazo ou de escopo em até 2 dias úteis, por escrito; no máximo 1 entrega do semestre teve aviso atrasado, puxado por pergunta ou ausente.
O meio da escala escrito como comportamento, sem "expectativas".
- 4
Avisa toda mudança de prazo ou de escopo em até 1 dia útil, por escrito e com o novo plano; nenhuma entrega do semestre precisou de pedido de status.
Mais rápido, com plano, e nenhum pedido de status.
- 5
Avisa toda mudança em até 1 dia útil, por escrito e com o novo plano, sem pedido de status; em pelo menos 2 entregas avisou o risco antes, com duas saídas e o custo de cada uma.
Outro comportamento: antecipar em vez de reagir — e ainda cumprir o 4 nas demais.
Duas decisões de redação evitam buracos entre os níveis. As contagens são limiares ("2 ou mais", "no máximo 1"), não números exatos, para que um semestre com duas falhas não caia entre "três ou mais" e "exatamente uma", como aconteceria com contagens exatas. E a descrição do tópico leva uma regra de desempate: quando a pessoa cumpre parte de dois níveis, vale o de baixo. Mesmo assim, "por escrito" e "com o novo plano" ainda dependem de quem lê o registro — e é para isso que existe o teste da seção seguinte.
Cole as cinco frases no verificador e o resultado é o oposto do exemplo: cinco de cinco níveis passam, sem defeito e sem aviso. Isso não prova que a escala é boa — prova que ela não tem os defeitos que o verificador sabe procurar. Quem decide se ela é boa são duas pessoas avaliando os mesmos casos.
Três observações sobre o que a reescrita custou. Primeiro, a escala nova só vale para quem tem entregas com prazo; um cargo de atendimento precisaria de outra. A descrição de cargo é o documento que diz qual comportamento importa para cada função — e é de lá que o tópico deveria sair. Segundo, "semestre" amarra a âncora ao ciclo; num ciclo anual, as contagens dobram. Terceiro, a escala precisa de evidência para ser usada: alguém tem de saber em quantas entregas o aviso atrasou, e isso só existe se o gestor anotou ao longo do período, nas 1:1 ou no registro de feedback. Uma escala comportamental sem registro de comportamento volta a ser impressão no dia da avaliação — o mesmo aviso vale para o ciclo de avaliação de desempenho inteiro. A disciplina de escrever cada célula, em vez de deixá-la para o avaliador, é a mesma da régua de promoção interna.
O teste das duas pessoas, com a conta inteira
O texto sobre entrevista estruturada propõe um teste simples para uma régua: dar a mesma resposta a duas pessoas e ver se as notas batem. Numa escala de desempenho o teste é o mesmo, com casos no lugar de respostas. Escreva dez resumos curtos de semestre — reais, anonimizados, ou inventados a partir de situações reais — e peça a duas pessoas que avaliam na sua empresa que deem nota a cada um, sem conversar. Depois faça três contas.
O exemplo a seguir é ilustrativo: os vinte números foram escolhidos para mostrar o que as contas revelam, e não vêm de nenhuma empresa. As mesmas duas pessoas avaliam os mesmos dez casos duas vezes — a primeira com a escala do verificador, a segunda com a escala reescrita.
| Caso | Antiga | Reescrita | ||
|---|---|---|---|---|
| A | B | A | B | |
| 1 | 4 | 3 | 2 | 2 |
| 2 | 3 | 3 | 3 | 3 |
| 3 | 4 | 3 | 4 | 4 |
| 4 | 4 | 4 | 1 | 1 |
| 5 | 3 | 4 | 3 | 3 |
| 6 | 5 | 4 | 5 | 4 |
| 7 | 4 | 3 | 4 | 4 |
| 8 | 3 | 3 | 2 | 2 |
| 9 | 4 | 3 | 3 | 3 |
| 10 | 4 | 4 | 4 | 5 |
| Média | 3,8 | 3,4 | 3,1 | 3,1 |
As células em laranja marcam onde A e B discordaram: seis casos na escala antiga, dois na reescrita. Com a antiga, as duas nunca ficaram a mais de um ponto uma da outra, e é justamente por esse motivo que a conta mais usada engana.
Escala antiga
100% · 40%
Concordância de até 1 ponto: 10 de 10. Concordância exata: 4 de 10. Kappa de Cohen: −0,03 — nada acima do que o acaso daria.
Escala reescrita
100% · 80%
Concordância de até 1 ponto: 10 de 10. Concordância exata: 8 de 10. Kappa de Cohen: 0,74.
Conta 1 — concordância exata: em quantos casos as duas deram a mesma nota. Conta 2 — concordância de até um ponto: em quantos a diferença foi de no máximo 1. É uma conta que aparece muito em apresentação de calibração, e é a mais fraca: numa escala de 1 a 5, duas pessoas sorteando notas ao acaso, cada nota com a mesma chance, ficam a no máximo um ponto uma da outra em 52% das vezes (13 das 25 combinações possíveis). Se as duas só usam o 3 e o 4 — o que acontece quando a escala é vaga e ninguém quer dar nota ruim —, a concordância de até um ponto é de 100% por construção. Quase foi o que aconteceu com a escala antiga: B só usou o 3 e o 4, e A só saiu disso uma vez, com o 5 do caso 6.
Conta 3 — kappa de Cohen: desconta o acordo que o acaso produziria, dado o jeito que cada avaliadora distribui as notas. A fórmula é κ = (po − pe) ÷ (1 − pe), em que po é a concordância exata observada e pe é a esperada ao acaso — a soma, nota por nota, da fração de A naquela nota vezes a fração de B. Na escala antiga, A deu 3 em três casos, 4 em seis e 5 em um; B deu 3 em seis casos e 4 em quatro. pe = 0,3 × 0,6 + 0,6 × 0,4 + 0,1 × 0 = 0,42, e κ = (0,40 − 0,42) ÷ 0,58 = −0,03. As duas concordaram tanto quanto duas pessoas que tivessem sorteado as notas com as mesmas preferências — nada além disso. Na escala reescrita, pe cai para 0,24 porque as notas se espalham de 1 a 5, e κ = (0,80 − 0,24) ÷ 0,76 = 0,74.
E há uma quarta leitura que não precisa de fórmula: a diferença entre as médias. Com a escala antiga, A ficou 0,4 ponto acima de B — ela deu a nota mais alta em cinco dos seis casos de discordância. Isso é leniência de uma avaliadora, não discordância sobre um caso, e é o que um comitê de calibração passaria o ciclo inteiro corrigindo nota a nota. Com a escala reescrita, a diferença de médias é zero e as duas discordâncias vão uma para cada lado.
Para montar a conta numa planilha, coloque os casos nas linhas 2 a 11, as notas de A na coluna B e as de B na coluna C, e os números 1 a 5 em E2:E6:
| Conta | Fórmula | No exemplo (antiga) |
|---|---|---|
| Concordância exata | =SOMARPRODUTO(--(B2:B11=C2:C11))/CONT.NÚM(B2:B11) | 0,40 |
| Até 1 ponto | =SOMARPRODUTO(--(ABS(B2:B11-C2:C11)<=1))/CONT.NÚM(B2:B11) | 1,00 |
| Esperada ao acaso | em F2, =CONT.SE(B$2:B$11;E2)*CONT.SE(C$2:C$11;E2), copiada até F6; depois =SOMA(F2:F6)/CONT.NÚM(B2:B11)^2 | 0,42 |
| Kappa de Cohen | =(G1-G2)/(1-G2), com a exata em G1 e a esperada em G2 | −0,03 |
| Diferença de médias | =MÉDIA(B2:B11)-MÉDIA(C2:C11) | 0,4 |
Quanto de kappa é suficiente? A convenção mais citada é a de Landis e Koch (1977), que chamaram as próprias faixas de arbitrárias: abaixo de zero, pobre; de 0 a 0,20, leve; de 0,21 a 0,40, razoável; de 0,41 a 0,60, moderada; de 0,61 a 0,80, substancial; acima disso, quase perfeita. Pela convenção, o 0,74 da escala reescrita é substancial e o −0,03 da antiga cai na faixa "pobre", no nível do acaso. Para uma escala de avaliação de desempenho, a regra prática deste texto é mais simples: se a concordância exata ficar abaixo da metade dos casos, ou se uma das pessoas estiver 0,3 ponto ou mais acima da outra na média, a escala volta para a oficina antes de o ciclo abrir. Dez casos são pouco para uma estatística fina — o intervalo de incerteza de um kappa com dez casos é largo —, mas são o bastante para encontrar a âncora que duas pessoas leem de jeitos diferentes, que é o objetivo.
Demonstração ao vivo
O combinado escrito antes da nota
Uma âncora de comportamento diz como a pessoa trabalhou; a outra metade da avaliação pergunta o que ela entregou, e essa só tem resposta se o combinado estiver escrito. Em 20 minutos de demonstração, alguém da Spire cadastra ao vivo, junto com você, objetivos e resultados-chave reais para as áreas que você indicar — o combinado que a avaliação vai ler no fim do semestre. Se o assunto que mais pesa for a avaliação, escolha "Avaliação de desempenho" em "O que mais dói hoje?" no formulário. A resposta com horários chega em até um dia útil.
Quantos pontos: 3, 4, 5 ou 7
A escolha do número de pontos é uma decisão muito discutida e que muda pouco o resultado — desde que as âncoras existam. O que a pesquisa oferece:
| Fonte | O que mediu | O que encontrou | Ressalva |
|---|---|---|---|
| Preston e Colman (2000) | 149 pessoas avaliando lojas e restaurantes em escalas de 2 a 11 pontos e de 101 | Fidedignidade teste-reteste de 0,86 a 0,89 com 2 a 4 pontos e de 0,91 a 0,94 com 5 a 10; escalas de 2, 3 e 4 pontos foram "as menos confiáveis, válidas e discriminantes" | Avaliação de serviço, não de desempenho no trabalho |
| Lozano, García-Cueto e Muñiz (2008) | Simulação de questionários com 2 a 9 opções | O ótimo fica entre 4 e 7 opções; abaixo de 4 a fidedignidade cai, acima de 7 quase não sobe | Simulação, não avaliadores reais |
| Talent Strategy Group (2026) | Mais de 250 organizações | 56,9% usam 5 pontos, 20% usam 4, 16,2% usam 3 | Mede o que as empresas fazem, não o que funciona |
A leitura prática: cinco pontos é o padrão por boas razões — tem meio, tem dois lados e cabe em cinco âncoras que alguém consegue escrever. Quatro tira o meio e obriga o avaliador a escolher um lado, o que tem valor quando a escala antiga acumulava todo mundo no 3; os custos são a fidedignidade um pouco menor que Preston e Colman mediram abaixo de cinco pontos e que a pessoa que de fato está no meio recebe uma nota que não descreve o semestre dela. Três ("abaixo / dentro / acima") perde capacidade de diferenciar e só se sustenta quando a nota serve para uma decisão binária. Sete ou mais pede sete âncoras que se distinguem umas das outras — raramente alguém escreve, e aí os pontos extras viram meio-ponto de impressão.
Mais importante que o número é a coerência: todo tópico do ciclo com a mesma quantidade de pontos, e as âncoras escritas para essa quantidade. Uma escala de 1 a 4 com âncoras copiadas de uma de 1 a 5 tem um nível sem texto — e a tela da ferramenta pode estar contando outra história, como mostra a próxima seção.
Como a Spire guarda a escala e as âncoras
No módulo de Desempenho da Spire, a escala é uma propriedade do ciclo: quem administra define a nota mínima e a máxima (a mínima é pelo menos 1, a máxima vai até 10, e o padrão é de 1 a 5), e o servidor recusa uma nota fora desse intervalo. As âncoras moram nos tópicos do ciclo: cada tópico tem título e uma descrição em texto livre, pode valer para todos ou só para alguns departamentos, pode ficar fora da autoavaliação e da avaliação de pares e indica qual eixo da matriz 9Box ele alimenta.
No formulário, quem avalia vê, para cada tópico, o título, a descrição logo abaixo e uma fileira de botões com os números da escala. É a descrição que carrega a âncora: o texto que você escreve ali é o que o avaliador lê no momento em que escolhe o número. Três comportamentos da tela ajudam a escala a ser usada como escrita:
- Nenhuma nota vem marcada na tela. O tópico começa com um traço no lugar do número, e o formulário não envia a avaliação enquanto faltar nota em algum tópico. (O rascunho guarda o ponto médio como valor inicial, e o envio pela Roberta não repete essa checagem da tela.)
- Comentário por tópico, obrigatório por padrão. O ciclo exige um comentário em cada tópico e um comentário geral, com um mínimo de caracteres configurável (padrão de 10), e o servidor confere no envio. É o lugar de escrever o episódio que justifica a nota — o mesmo tipo de frase do passo 1 da oficina.
- Tópicos diferentes por área e por relação. Uma escala de "avisar mudança de prazo" pode valer só para os departamentos que têm entregas com prazo, e um tópico de metas pode ficar fora da autoavaliação e da avaliação de pares.
Ao lado do número escolhido, a tela mostra um rótulo genérico, calculado pela posição da nota dentro da escala do ciclo: o primeiro quinto da escala vira "Precisa Melhorar", o seguinte "Abaixo das Expectativas", depois "Atende Expectativas", "Supera Expectativas" e "Excepcional". Numa escala de 1 a 5 cada número tem o seu rótulo. Em outros tamanhos, não:
| Escala | 1 | 2 | 3 | 4 | 5 |
|---|---|---|---|---|---|
| 1 a 3 | Precisa Melhorar | Atende Expectativas | Excepcional | — | — |
| 1 a 4 | Precisa Melhorar | Abaixo das Expectativas | Supera Expectativas | Excepcional | — |
| 1 a 5 | Precisa Melhorar | Abaixo das Expectativas | Atende Expectativas | Supera Expectativas | Excepcional |
Na escala de 1 a 4, a nota 3 aparece como "Supera Expectativas" e nenhuma nota recebe "Atende". Se a sua âncora do 3 descreve o trabalho esperado para o cargo, o avaliador vai ler uma coisa na descrição e outra ao lado do botão. A saída é escrever as quatro âncoras na descrição e dizer ao time, no treino, que a âncora é que vale — ou ficar com a escala de 1 a 5, em que cada número tem um rótulo próprio. Mesmo nela, o rótulo da tela é da família de "expectativas" que a regra 4 condena: ali ele funciona como título curto, e é a âncora da descrição que diz o que "atender" quer dizer.
A Roberta, a agente de IA da Spire, consegue criar um tópico num ciclo com título e descrição, para quem tem permissão de gerir desempenho e com o módulo ligado. Na prática: escreva as âncoras na oficina, passe-as no verificador e peça à Roberta que crie o tópico com aquele texto — o que ela não faz é substituir o passo 2, porque retradução é concordância entre pessoas.
O que a tela não faz
- Não existe um campo por nível. As cinco âncoras vão juntas na descrição do tópico.
- A descrição aparece como um parágrafo corrido. Quebras de linha não são mantidas no formulário — escreva as âncoras em sequência, separadas por um marcador, como no bloco da próxima seção.
- O rótulo genérico não pode ser trocado. Ele aparece ao lado do número mesmo quando a sua âncora diz outra coisa; por isso a tabela acima.
- A descrição pode ser trocada com o ciclo em andamento. Quem já avaliou leu o texto anterior; feche a redação das âncoras antes de abrir o ciclo.
- A Roberta cria tópicos, mas não edita um tópico existente. A correção de uma âncora depois de criada é feita na tela de administração do ciclo.
Pronto para colar: a escala no formato do campo de descrição
É assim que a escala reescrita deste texto fica dentro do campo de descrição de um tópico — um parágrafo só, com o objeto na frente e cada nível marcado pelo número. Troque o comportamento e as contagens pelas da sua oficina; o formato é o que faz a âncora caber na tela sem virar um bloco que ninguém lê.
Como a pessoa avisa mudança de prazo e de escopo ao longo do semestre. Quando a pessoa cumpre parte de dois níveis, vale o de baixo. 1 — Em 2 ou mais entregas do semestre, o time soube de mudança de prazo ou de escopo pela data vencida ou por outra área, sem aviso da pessoa. · 2 — Em 2 ou mais entregas do semestre, o aviso de mudança de prazo ou de escopo veio puxado por pergunta, depois de 2 dias úteis, depois da data ou não veio. · 3 — Avisa mudança de prazo ou de escopo em até 2 dias úteis, por escrito; no máximo 1 entrega do semestre teve aviso atrasado, puxado por pergunta ou ausente. · 4 — Avisa toda mudança de prazo ou de escopo em até 1 dia útil, por escrito e com o novo plano; nenhuma entrega do semestre precisou de pedido de status. · 5 — Avisa toda mudança em até 1 dia útil, por escrito e com o novo plano, sem pedido de status; em pelo menos 2 entregas avisou o risco antes, com duas saídas e o custo de cada uma.
Uma escala assim não garante nota justa — a pesquisa foi clara sobre isso. Garante que, quando duas pessoas discordarem, elas vão discordar sobre um fato do semestre, e não sobre o que a palavra "bom" quer dizer. É uma discussão que se resolve olhando o calendário. A outra, nenhum comitê resolve.
Perguntas frequentes sobre escala de avaliação de desempenho
O que é uma escala de avaliação de desempenho?
É o conjunto de pontos (1 a 5, por exemplo) e do texto que diz o que cada ponto significa, usado para dar nota a cada tópico de uma avaliação. No levantamento de 2026 da consultoria Talent Strategy Group, 56,9% das organizações que avaliam com nota usam cinco pontos, 20% usam quatro e 16,2% usam três.
O que é uma âncora na escala de avaliação?
É a frase que acompanha cada ponto e descreve o comportamento que vale aquele número — por exemplo, "avisa mudança de prazo em até 2 dias úteis, por escrito" para a nota 3. Sem âncora, cada avaliador decide sozinho o que o número quer dizer.
O que é BARS?
É a sigla em inglês de behaviorally anchored rating scales, escalas ancoradas em comportamento. O método foi publicado por Smith e Kendall em 1963: gestores escrevem episódios reais de trabalho bom, comum e ruim, outros gestores os reclassificam às cegas (a retradução) e só os episódios em que pelo menos metade concorda viram âncoras de cada nível.
Escala ancorada em comportamento reduz erro de avaliação?
Pouco. As revisões de Jacobs, Kafry e Zedeck (1980) e de Kingstrom e Bass (1981) encontraram diferenças pequenas ou nulas entre a BARS e outros formatos em leniência, efeito halo e concordância; num estudo de 1975, o formato não explicou mais de 5% da variância. O ganho está no uso: treino de avaliadores, calibração e feedback apontando para uma frase escrita.
Qual é o melhor número de pontos para uma escala de desempenho?
Cinco a sete, se a pergunta for só psicométrica: Preston e Colman (2000) acharam as escalas de 2 a 4 pontos as menos confiáveis, e a simulação de Lozano e colegas (2008) põe o ótimo entre 4 e 7. Cinco é o mais usado e o mais fácil de ancorar; quatro tira o ponto do meio e obriga a escolher um lado. O que mais importa é todos os tópicos do ciclo terem o mesmo número de pontos e uma âncora escrita para cada um.
Como escrever "atende às expectativas" do jeito certo?
Escrevendo a expectativa. "Atende às expectativas" só funciona se o padrão estiver escrito; o lugar dele é a própria âncora. Troque a frase pelo comportamento esperado para o cargo, com contagem e prazo: em vez de "atende às expectativas de comunicação", "avisa mudança de prazo ou de escopo em até 2 dias úteis, por escrito".
Como saber se as âncoras estão boas?
Peça a duas pessoas que avaliem os mesmos dez casos com a escala, sem conversar, e calcule a concordância exata, o kappa de Cohen e a diferença entre as médias. A concordância de até um ponto engana: numa escala de 1 a 5, duas notas sorteadas ficam a no máximo um ponto uma da outra em 52% das vezes.
Como calcular o kappa de Cohen numa planilha?
Com as notas de A na coluna B e as de B na coluna C (linhas 2 a 11): a concordância observada é =SOMARPRODUTO(--(B2:B11=C2:C11))/CONT.NÚM(B2:B11); a esperada ao acaso é a soma, nota por nota, de CONT.SE de A vezes CONT.SE de B, dividida pelo número de casos ao quadrado; o kappa é (observada − esperada) ÷ (1 − esperada).
O verificador de âncoras guarda o que eu escrevo?
Não. Ele roda inteiro no navegador, sem enviar nada, e o texto some quando a página é fechada. As regras são listas de palavras e uma comparação entre níveis vizinhos, descritas na seção "As sete regras".
Fontes
- Talent Strategy Group, 2026 Performance Management Report, publicado em 22/02/2026; mais de 250 organizações responderam ao questionário nos dois últimos meses de 2025. Daqui saem as parcelas por tamanho de escala (56,9% / 20% / 16,2% / 6,9%) e os 92,4% que usam nota. Levantamento com organizações, sem dado de percepção de quem é avaliado.
- Fortune, 13/01/2026, sobre o novo sistema de avaliação da Meta, a partir de documentos internos obtidos pelo Business Insider; as parcelas (cerca de 20/70/7/3%) são as descritas nos documentos para o ciclo de 2026, não um resultado apurado.
- Gartner, pesquisa com 2.947 funcionários e gestores ouvidos entre novembro e dezembro de 2025, divulgada em 2026 (lida numa reprodução do release, porque gartner.com não abriu): 39% dos funcionários concordam que o gestor é eficaz em dar feedback claro de desenvolvimento.
- Smith, P. C.; Kendall, L. M. (1963). Retranslation of expectations. Journal of Applied Psychology, 47(2), 149–155.
- Borman, W. C.; Dunnette, M. D. (1975). Journal of Applied Psychology, 60(5), 561–565 — 23 avaliadores; efeito do formato ≤ 5% da variância.
- Jacobs, R.; Kafry, D.; Zedeck, S. (1980). Expectations of behaviorally anchored rating scales. Personnel Psychology, 33, 595–640.
- Kingstrom, P. O.; Bass, A. R. (1981). Personnel Psychology, 34(2), 263–289.
- Scullen, S. E.; Mount, M. K.; Goff, M. (2000). Journal of Applied Psychology, 85(6), 956–970 — efeito idiossincrático do avaliador de 62% e 53% da variância.
- Klieger, D. M. et al. (2018). ETS Research Report RR-18-24 — cerca de 430 episódios, 398 frases, 65 gestores na retradução; corte de 50% na mesma categoria; 48 frases descartadas pelo critério de dispersão.
- Preston, C. C.; Colman, A. M. (2000). Acta Psychologica, 104, 1–15 — 149 participantes, escalas de 2 a 11 e de 101 pontos, avaliação de serviços.
- Lozano, L. M.; García-Cueto, E.; Muñiz, J. (2008). Methodology, 4(2), 73–79 — simulação, 2 a 9 opções.
- Bocklisch, F.; Bocklisch, S. F.; Krems, J. F. (2012). Behavior Research Methods, 44, 144–157 — 89 e 109 participantes, expressões de frequência em alemão. Schaeffer, N. C. (1991). Public Opinion Quarterly, 55, 395 — amostra nacional dos EUA de 1975, 1.172 pessoas.
- Landis, J. R.; Koch, G. G. (1977). Biometrics, 33, 159–174 — faixas convencionais de interpretação do kappa.


