Duas áreas da mesma empresa. O mesmo formulário, a mesma escala de 1 a 5, o mesmo ciclo. Numa delas a média das notas fecha em 4,25; na outra, em 2,75. Ninguém mentiu e ninguém foi negligente — as duas áreas entregaram mais ou menos a mesma coisa no ano. A diferença inteira está em quem preencheu o formulário.
É para isso que existe a calibração de avaliação de desempenho: para tirar a identidade do avaliador de dentro da nota. É uma prática de maioria, não de vanguarda — 84,7% das organizações ouvidas no 2026 Performance Management Report da Talent Strategy Group fazem reuniões de calibração, e no recorte brasileiro do estudo Tendências de RH da Korn Ferry 75% das empresas promovem calibração como uma das etapas do processo.
E, mesmo assim, só 22% dos trabalhadores americanos concordam fortemente que o processo de avaliação da empresa deles é justo e transparente — número da Gallup, campo em agosto de 2023. As duas pontas não são a mesma amostra: uma conta empresas, a outra conta pessoas, e em países diferentes. Mas a distância entre "quase todo mundo calibra" e "menos de um em cada quatro acha justo" é grande demais para ser só ruído de comparação: em algum lugar entre a reunião e a pessoa avaliada, a calibração está fazendo alguma coisa diferente do que promete — e essa percepção é do tipo que chega à pesquisa de clima como número, sem trazer junto a causa.
Este texto separa as duas coisas que cabem na mesma palavra: a calibração que corrige, removendo a diferença de escala entre quem avalia, e a que disfarça, usando a reunião para encaixar pessoas numa curva decidida antes. Você vai encontrar aqui a aritmética que derruba a curva forçada num time de sete, o que 1.333 notas calibradas de verdade dizem sobre para onde um comitê move nota, a pré-leitura de seis números que faz a reunião durar uma hora em vez de quatro, o protocolo da mesa, três indicadores para medi-la e uma ata publicada por inteiro.
Oito bolinhas por tira, uma por avaliado, empilhadas na coluna da nota que receberam. No modelo, os dois times têm exatamente a mesma distribuição de qualidade — o que muda é só quem preencheu. As duas marcas laranja receberam a mesma nota 4 e estão a um ponto e meio de distância no modelo: no time A, alguém que vale 3,0; no time B, a melhor das oito, que vale 4,5.
Junte os dois times e ordene as dezesseis pessoas pela nota. Sete das oito primeiras colocadas são do time A, embora os dois times sejam idênticos por construção. A nota 4, nesse conjunto, foi dada a gente que no modelo vale 3,0, 3,5 e 4,5. A nota 3 foi dada a gente que vale 2,5, 3,5 e 4,0. A escala inteira entre 2,5 e 4,5 colapsou em dois números, e o que decide em qual deles você cai não é o seu trabalho: é o seu gestor.
É aqui que o problema deixa de ser filosófico. Se essa lista alimenta bônus, promoção ou matriz 9Box, a empresa está distribuindo dinheiro e cargo por área de origem e chamando isso de mérito — é assim que uma política de promoção interna bem escrita é desmontada pelo insumo que a alimenta. E as pessoas do time B percebem, mas costumam dizer em voz alta só na conversa de saída, quando já não dá para consertar.
Calibração de avaliação de desempenho: o que a mesa corrige e o que ela não corrige
Uma reunião de calibração de avaliação de desempenho não é uma reunião de revisão de notas. Se ela abrir com "vamos passar caso a caso e ver se a nota está certa", ela vira uma sessão de opinião de quatro horas em que ganha quem argumenta melhor. O que a mesa consegue resolver é uma lista curta e específica, e vale escrevê-la na primeira página da pauta.
Três divergências que a mesa resolve
- Escala diferente
- Um avaliador usa 4 como "bom" e 5 como "excepcional"; outro usa 5 como "fez o combinado". A mesa compara as médias por avaliador, não as notas caso a caso.
- Âncora diferente
- Um gestor compara a pessoa com o resto do time dele; outro, com o que o cargo exige. Numa área forte a mesma entrega vira 3; numa fraca, vira 5. A mesa devolve a âncora para a descrição do cargo, que é onde ela deveria estar escrita — e por isso a descrição precisa dizer qual é o desempenho esperado.
- Evidência desigual
- Um avaliador viu o trabalho de perto o ano inteiro; outro viu dois relatórios. Não é má-fé, é exposição. A mesa resolve juntando as evidências que os outros participantes têm e registrando quais entraram.
Duas coisas que ela não resolve
- Desempenho realmente diferente
- Um time pode ter tido um ano melhor que o outro. Diferença entre times não é erro — é informação. Uma mesa que nivela tudo apaga o único dado que a empresa tinha sobre onde o trabalho aconteceu.
- Um instrumento mal escrito
- Se "colaboração: 1 a 5" é tudo que está escrito, não existe calibração possível: dois avaliadores não convergem sobre uma régua que não existe. Isso se conserta antes do ciclo, ancorando cada nível com comportamento observável, do mesmo jeito que uma entrevista estruturada ancora a régua do scorecard. A mesa não é lugar de reescrever formulário.
O teste de uma frase para a pauta. Antes de pôr um caso na mesa, pergunte: a divergência aqui é sobre a pessoa ou sobre a régua? Se for sobre a pessoa, é conversa de gestor com gestor e não precisa de comitê. Se for sobre a régua, é caso de calibração — e a decisão vale para todo mundo que aquele avaliador avaliou, não só para o caso discutido.
A curva forçada não fecha dentro do time
A distribuição esperada é um instrumento comum: você diz aos avaliadores que, mais ou menos, 20% das pessoas devem ficar acima do esperado, 70% dentro e 10% abaixo. Na amostra da Talent Strategy Group, 63,6% das organizações entregam ao avaliador uma distribuição esperada. Dessas, 34,1% a tornam obrigatória (a curva forçada) e 65,9% a tratam como orientação, com liberdade para desviar. Multiplicando as duas, cerca de 21,7% de todas as organizações da amostra forçam a curva — essa multiplicação é aritmética deste texto, não um número publicado pelo relatório.
O problema da curva forçada não é ideológico. É de divisão.
Uma distribuição é um enunciado sobre uma população, e quase sempre é aplicada a um time. Um time não é uma população: ele tem sete pessoas, e 10% de sete é 0,7 de uma pessoa. Não existe 0,7 de nota. Arredonde para cima e você obrigou um time de sete a produzir alguém abaixo do esperado; para baixo, e a distribuição da empresa não fecha. A escolha entre uma coisa e outra é feita, na prática, pelo hábito de arredondamento de quem montou a planilha — e um critério que só se define depois de ver os números é exatamente o que uma nota de corte declarada antes da prova existe para impedir.A tabela abaixo aplica uma curva de 20% / 70% / 10% a uma empresa fictícia de sessenta pessoas divididas em seis áreas, arredondando cada cota para o inteiro mais próximo. A empresa é inventada; as contas, não — cada cota foi calculada, e o problema que aparece nelas aparece em qualquer empresa com áreas desse tamanho.
| Área | Pessoas | Cota bruta (acima · dentro · abaixo) | Arredondada | Soma |
|---|---|---|---|---|
| Engenharia | 23 | 4,6 · 16,1 · 2,3 | 5 · 16 · 2 | 23 ✓ |
| Comercial | 12 | 2,4 · 8,4 · 1,2 | 2 · 8 · 1 | 11 — falta 1 |
| Operações | 9 | 1,8 · 6,3 · 0,9 | 2 · 6 · 1 | 9 ✓ |
| Marketing | 7 | 1,4 · 4,9 · 0,7 | 1 · 5 · 1 | 7 ✓ |
| Financeiro | 5 | 1,0 · 3,5 · 0,5 | 1 · 4 · 1 | 6 — sobra 1 |
| Suporte | 4 | 0,8 · 2,8 · 0,4 | 1 · 3 · 0 | 4 ✓ |
| Empresa inteira | 60 | 12,0 · 42,0 · 6,0 | 12 · 42 · 6 | 60 ✓ |
Em telas estreitas, a tabela rola para o lado.
- A curva fecha na empresa e não fecha na área. Somadas, as seis áreas dão exatamente 12 · 42 · 6 — a cota da empresa inteira, certinha. Mas duas das seis áreas, isoladamente, não têm como cumprir a cota com gente inteira: no Comercial falta uma pessoa para distribuir e no Financeiro sobra uma cota sem pessoa.
- O arredondamento decide quem fica abaixo. Marketing tem sete pessoas e cota de 0,7 abaixo do esperado: arredondando para cima, uma pessoa real recebe a pior nota do ciclo porque 0,7 está mais perto de 1 do que de 0. Suporte tem quatro pessoas e cota de 0,4: arredondando para baixo, ninguém fica abaixo. Duas áreas pequenas, dois tratamentos opostos, e a diferença entre elas é de três décimos de pessoa.
- Quanto menor o time, mais a cota vira sorteio. Em Engenharia, com 23 pessoas, cada cota tem folga: 4,6 e 2,3 arredondam sem drama. Em Suporte, com quatro, a cota do topo é 0,8 — ou seja, a área tem 80% de uma vaga de destaque, e recebe uma inteira ou nenhuma.
A saída não é abandonar a distribuição, é mudar onde ela é aplicada. Uma distribuição orientada, declarada no nível em que ela tem gente suficiente para ser divisível — a diretoria inteira, não o time de quatro —, faz o trabalho de sinalizar o que a empresa espera sem obrigar nenhum gestor a inventar um "abaixo do esperado". É, aliás, o que a maioria faz: dois terços de quem usa distribuição a usa como orientação. O relatório da Talent Strategy Group observa que a efetividade percebida sobe conforme a distribuição fica mais definida e mais forçada — mas percepção de quem administra o processo não é justiça medida em quem o recebe, e o próprio relatório pede ceticismo com a amostra.
Para onde um comitê de calibração realmente move a nota
Quase tudo que se escreve sobre comitê de calibração é prescritivo. Existe pouca medição de comitês reais, e o trabalho mais completo que encontrei é um estudo de Demeré, Sedatole e Woods sobre o departamento de auditoria interna de uma multinacional — dados proprietários, 1.333 notas de 686 pessoas, dadas por 110 supervisores distintos e passadas por 12 comitês de calibração, entre 2007 e 2009.
O que os comitês fizeram com essas notas:
- 327 notas ajustadas — 24,5% do total. Três de cada quatro notas saíram da mesa como entraram.
- 262 ajustes para baixo e 65 para cima. Para cada nota que um comitê subiu, ele desceu quatro.
- A média caiu pouco: de 3,559 para 3,511, menos de cinco centésimos numa escala de 1 a 5.
- O desvio-padrão caiu 6,4%: de 0,590 para 0,552. A distribuição ficou mais estreita.
A conclusão dos autores é a que interessa: os comitês de fato removem diferenças de distribuição entre avaliadores — fazem o trabalho para o qual existem. Mas têm uma preferência assimétrica por baixar nota alta em vez de subir nota baixa. O efeito líquido é que eles mitigam a leniência e agravam a centralidade: menos gente no topo, menos gente na base, mais gente no meio.
Leia esses quatro números com a mão no freio. São doze comitês de uma empresa só, numa função só, com dados que hoje têm quase duas décadas. A empresa é uma multinacional com 22 escritórios pelo mundo e o estudo não publica recorte por país — ou seja, não dá para saber quanto daquilo se parece com o Brasil. Nada aqui é meta: se a sua mesa mexer em 10% ou em 40% das notas, isso não a aproxima nem a afasta de "certa". O que sobrevive à troca de contexto são as duas formas — a assimetria de quatro para um e a distribuição que encolhe —, e a próxima seção mostra que elas têm causas diferentes: a segunda é aritmética da escala; a primeira não é aritmética nenhuma.
Por que a mesa empurra para o meio, mesmo sem querer
A explicação não exige má-fé nem política. Numa escala de inteiros de 1 a 5, quando a mesa decide que um avaliador está brando e precisa descer, a única forma de descer a média dele é mexer em notas individuais — e cada mexida vale um ponto inteiro. Quais notas são as mais fáceis de mexer? As dos extremos — em tese, porque só elas têm uma direção óbvia. Um 5 dado por um avaliador brando só pode ir para baixo; um 2 dado por um avaliador severo só pode ir para cima. Um 4 no meio da distribuição tem dois destinos defensáveis, e por isso o argumento para mexer nele é mais caro. Os extremos, além disso, são exatamente o que carrega a dispersão — então alinhar avaliadores custa dispersão de notas, e esse custo é estrutural, não moral.
Mas a explicação mecânica só cobre metade do que aconteceu, e é a outra metade que importa. O estudo testou as duas pontas separadamente, e elas não se comportaram igual:
- Uma nota alta extrema tem cerca de três vezes mais chance de ser mexida que uma nota do meio (razão de chances de 3,05, p < 0,01).
- Uma nota baixa extrema não tem chance maior de ser mexida que uma nota do meio (razão de chances de 0,71, sem significância estatística — ou seja, indistinguível de "nenhuma diferença").
- O mesmo vale um nível acima: as notas de um avaliador com média alta têm cerca de três vezes mais chance de serem ajustadas; as de um avaliador com média baixa, nenhuma chance maior.
Isso reescreve a conclusão. A mesa não move "os extremos": ela move o extremo de cima. Não é falta de material — descer 262 notas já é mais do que as 246 notas acima de 4,00 que existiam, então boa parte das descidas veio do meio. É outra coisa, e ela é desconfortável: uma nota alta é tratada como algo que precisa ser justificado, e uma nota baixa não. O comitê policia generosidade. Severidade passa.
Vale ser exato sobre o que isso significa para quem está no time B do gráfico lá em cima, porque o estudo mede propensão, não ausência. Quando a mesa encostou nas notas de um avaliador severo, ela subiu todas — não desceu nenhuma. O que ela não fez foi ir atrás dele: a chance de as notas de um avaliador severo serem revisadas era a mesma de um avaliador médio. Generosidade é procurada; severidade é aceita quando aparece. E é assim que uma mesa de calibração vira, na prática, um corte de orçamento com nome de justiça — porque baixar nota economiza bônus e subir nota custa. O jeito de saber de que lado a sua mesa está não é a intenção de quem senta nela: é medir, o que a seção de indicadores, mais adiante, faz com três números — e o terceiro existe só para isso.
A pré-leitura: seis números por avaliador
A diferença entre uma calibração de uma hora e uma de quatro é o que chega pronto na mesa. Se a reunião começa com as notas e sem contexto, o grupo gasta o tempo reconstruindo o que o RH já tinha. A pré-leitura é uma tabela com uma linha por avaliador — não por avaliado —, enviada quarenta e oito horas antes, e é ela que decide de quem se fala primeiro.
A unidade ser o avaliador é a decisão de projeto mais importante da mesa: uma pré-leitura por pessoa avaliada convida à revisão caso a caso; uma por avaliador convida à comparação de réguas, que é o que a calibração pode resolver.
| Número | Como se calcula | O que ele diz | A pergunta que ele abre |
|---|---|---|---|
| 1. Média do avaliador | Soma das notas que ele deu ÷ número de avaliados | Onde a régua dele se apoia | "A sua média é 4,25 e a média de quem avalia nesta mesa é 3,85. O que explica a diferença?" |
| 2. Abertura da régua dele | Maior nota que ele deu menos a menor | Se ele diferencia | "Você deu 4 para as nove pessoas. Nenhuma delas teve um ano diferente das outras?" |
| 3. Notas no extremo | Quantas notas ele deu no valor mínimo e no máximo da escala | Onde a mesa vai mexer | "Estes quatro 5 são o que você chamaria de excepcional na empresa inteira?" |
| 4. Número de avaliados | Contagem simples | Quanto peso a média merece | "Média de 4,8 sobre três pessoas não é um padrão, é uma amostra." |
| 5. Comentários com evidência datada | Quantos comentários citam um fato com data ou entregável nomeado ÷ total de comentários | Se a nota tem lastro | "Dos oito comentários, dois citam um fato. Os outros seis vão sustentar a nota numa conversa difícil?" |
| 6. Avaliações não enviadas | Atribuições do ciclo sem envio até a véspera da mesa | Que notas ainda vão mudar sozinhas | "Esta pessoa está sem dois pares. A nota dela na tela hoje não é a nota dela." |
Em telas estreitas, a tabela rola para o lado.
O sexto parece burocrático e é o que mais estraga mesa. Quando a nota final é uma média ponderada de autoavaliação, gestor e pares, uma avaliação que não chegou não deixa um buraco: ela muda o peso das outras. A seção sobre a Spire, mais abaixo, faz essa conta — um par ausente move a nota em um terço de ponto, sem ninguém ter mudado de ideia.
O protocolo do comitê de calibração
Uma calibração sem protocolo vira negociação, e numa negociação ganha quem fala melhor. As sete regras abaixo existem para que o resultado de um comitê de calibração dependa da evidência e não da retórica — e são curtas de propósito, para caberem na primeira página da pauta e serem lidas em voz alta na abertura.
- Quem participa avalia. A mesa é formada por quem deu nota naquele ciclo, mais um facilitador de RH que não avalia ninguém. Quem não avaliou não vota — não porque não tenha opinião, mas porque não tem régua para comparar.
- Começa pelas réguas, não pelos casos. A primeira meia hora é sobre a pré-leitura: as médias, as aberturas de régua, as notas no extremo. A mesa só desce para um nome depois de decidir se alguma régua está deslocada.
- O ônus da prova é de quem quer mudar. A nota entra na mesa como está. Quem propõe alterá-la traz o fato — data, entregável, situação —, e não o adjetivo. "Ele é muito bom" não move nota; "ele assumiu a migração em março e ela entrou sem incidente" move.
- Ajuste de régua reprecifica a lista inteira daquele avaliador, não uma pessoa. Numa escala de inteiros isso não é descer todo mundo um ponto: é reavaliar a lista toda contra a régua corrigida e mover as notas que cruzam a fronteira. Se só uma se mexer, tudo bem — o que não pode é a mesa escolher uma pessoa e não olhar as outras. Na ata, a decisão fica registrada como de régua, e a lista inteira consta como revista.
- Um caso tem cinco minutos e um cronômetro visível. Se cinco minutos não resolvem, o caso não é de calibração: é de evidência insuficiente, e vai para uma lista de pendências com um responsável e uma data.
- O que a mesa não decide: promoção, aumento, desligamento, sucessão. Usam a nota como insumo e acontecem em outra reunião, com outro material. Misturar as duas faz o gestor negociar a nota pelo efeito dela no salário — o contrário de calibrar. Se a sua empresa já separou os rituais por decisão que sai de cada um, essa regra já está escrita.
- Toda nota movida vira uma linha de ata. Quem, de quanto para quanto, com qual evidência e quem propôs. Sem esse registro, a mesa não é auditável e, no ciclo seguinte, ninguém lembra por que aquela pessoa desceu.
A regra 6 é a que mais se quebra, e a mais cara. No estudo da Talent Strategy Group, só 7,1% das organizações declaram não conectar avaliação e recompensa — ou seja, 92,9% conectam, distribuídos em 55,3% com faixas de recompensa por nota e liberdade dentro delas, 18,4% com uma ligação direta e 19,1% com discricionariedade quase total. (Os três somam 92,8% por arredondamento; a subtração de 100 é deste texto.) Ou seja: em quase toda empresa a nota vale dinheiro, e o gestor que entra na mesa sabendo quanto custa cada ponto não está calibrando — está defendendo orçamento da equipe dele. O antídoto é temporal: calibre antes de a régua de recompensa ser aplicada e trate a conversão em dinheiro como um passo separado, do mesmo jeito que um plano de cargos e salários mantém a faixa separada da pessoa.
Diagnóstico gratuito · 8 perguntas
Em que estágio está o seu ciclo de gestão de pessoas?
São oito perguntas fechadas e cerca de noventa segundos de relógio. Duas olham para desempenho; as outras seis, para metas, desenvolvimento e clima. A nota e a primeira coisa a arrumar aparecem na própria tela, depois de um cadastro curto — nome, e-mail corporativo, porte da empresa e o seu cargo.
Como a Spire faz
A Spire é uma plataforma de RH que cobre operação, talentos e estratégia no mesmo lugar, e o ciclo de avaliação é um dos módulos. Vale dizer de saída o que não existe: a Spire não tem um objeto "calibração" — nem tela de comitê, nem campo de nota ajustada, nem trilha de quem mudou o quê. Dito isso, o ciclo tem três características que determinam quando e como uma mesa pode acontecer em cima dele: as duas primeiras são restrições impostas pelo código, a terceira é um comportamento do cálculo que muda a nota sem ninguém pedir.
Um ciclo de avaliação na Spire carrega a régua, os pesos e as travas de preenchimento. Por padrão a escala vai de 1 a 5 — que é, aliás, a escala de 56,9% das organizações da amostra da Talent Strategy Group —, o comentário por tópico é obrigatório com um mínimo de dez caracteres, e o nome de quem avaliou fica oculto para quem foi avaliado. Cada tópico da avaliação declara a qual eixo da 9Box ele pertence: desempenho, potencial ou ambos. Os pesos entre autoavaliação, gestor e pares nascem em 33,33 / 33,33 / 33,34 e são editáveis por ciclo.
Três coisas para saber antes de marcar a mesa
1. Só quem escreveu a nota pode mudá-la
A edição de uma avaliação é recusada para qualquer pessoa que não seja o avaliador daquela atribuição — inclusive para um administrador com permissão de gestão de desempenho. Não existe "o comitê ajustou". O que existe — e funciona bem — é outro caminho: a mesa decide e o avaliador volta e reescreve a própria nota, com o comentário atualizado. É mais lento e tem uma vantagem que compensa: quem defende a nota na conversa com a pessoa é quem a escreveu, e ela não apareceu de um comitê anônimo.
2. A janela fecha na data de fim do ciclo
Uma avaliação pode ser editada enquanto o ciclo está ativo e a pessoa avaliada ainda não deu ciência. Passada a data de fim do ciclo, a edição é recusada. E a nota só chega ao avaliado quando todos os avaliadores enviaram e o ciclo terminou. Isso desenha a janela de calibração com precisão: ela vai do último envio até a data de fim do ciclo, e nada foi entregue a ninguém nesse intervalo. Marque a mesa dentro dela — e, se marcar depois, não há o que reescrever.
3. O peso se redistribui quando falta avaliação
Quando um tipo de relação não tem nenhuma avaliação enviada, o peso dele sai do denominador em vez de contar como zero — o que é a decisão certa, e tem um efeito que a conta abaixo mostra.
O terceiro ponto merece a conta escrita. Com os pesos padrão de 33,33 / 33,33 / 33,34:
| Situação | Auto | Gestor | Pares | Nota final |
|---|---|---|---|---|
| Ana, ciclo completo | 4 | 3 | 5 e 3 | 3,67 |
| Ana, se o par que deu 3 não enviar | 4 | 3 | 5 | 4,00 |
| Bruno, sem nenhum par | 4 | 3 | — | 3,50 |
Em telas estreitas, a tabela rola para o lado.
Ana e Bruno receberam a mesma autoavaliação e a mesma nota do gestor, e terminam em 3,67 e 3,50: o que os separa é quem enviou. A segunda linha é a que assusta — um único par que esquece de enviar move a nota de Ana em um terço de ponto, e para cima, porque o que sumiu foi a avaliação mais baixa. Uma mesa que abre com a lista de notas e não com a coluna de envios pendentes calibra números que ainda vão mudar sozinhos.
Há mais um detalhe do produto que a mesa precisa saber antes de olhar para a 9Box, e ele é mais incômodo do que parece. Cada tópico do ciclo declara a qual eixo pertence — desempenho, potencial ou ambos —, e o padrão é "ambos". Com o padrão intocado, o eixo de desempenho e o eixo de potencial são calculados sobre o mesmo conjunto de tópicos, com a mesma média e a mesma normalização. Os dois eixos ficam iguais, e a matriz colapsa numa diagonal: todo mundo cai em uma de três caixas — a de baixo à esquerda, a do meio, a de cima à direita. As outras seis caixas, que são a razão de existir de uma 9Box, ficam permanentemente vazias.
Há um segundo caminho, mais raro: se todos os tópicos forem marcados como sendo só de desempenho, o potencial passa a ser inferido — do crescimento contra um ciclo de comparação que você tenha selecionado ou, na falta dele, de uma função da média e da variância das próprias notas de desempenho. Os dois caminhos chegam ao mesmo lugar: o que você está lendo como potencial é uma função do desempenho, o que apaga justamente quem contribui sem aparecer em resultado de linha, como quem lidera sem ter cargo de gestão. Se a sua empresa usa a 9Box para valer, marque explicitamente quais tópicos são de potencial — e só esses. Enquanto isso não for feito, a matriz é um gráfico de uma variável só, e levá-la para uma mesa de sucessão é decidir com metade da informação que a tela aparenta ter.
E há uma ironia que este texto tem obrigação de publicar. A 9Box da Spire não posiciona ninguém por nota: ela ordena todo mundo em cada eixo e corta em terços — ou seja, aplica exatamente a curva forçada que as primeiras seções deste post derrubam. Um terço do quadro cai na coluna de baixo desempenho e um terço na de cima quaisquer que sejam as notas, mesmo que as trinta pessoas tenham tirado 4. Somado ao padrão ambos descrito acima, um ciclo sem tópicos de potencial marcados produz uma matriz de três caixas em que um terço da empresa é sempre "baixo desempenho e baixo potencial" e um terço é sempre "estrela" — por construção, não por medição.
Cortar em terços é leitura defensável de uma 9Box, que é mesmo uma ferramenta de posição relativa. Mas diga isso em voz alta na mesa: você passou uma hora tirando a arbitrariedade do avaliador de dentro das notas e a tela seguinte reintroduz uma cota que ninguém decidiu.
Onde a pré-leitura mora hoje — e onde ainda não mora. A diferença entre "tem tela" e "tem endpoint" é o tempo de alguém no meio, então vale ser exato.
- Os números 1 a 4 saem de uma chamada de API, não de uma tela.
GET /performance/evaluationsfiltra por ciclo, por avaliador e por situação, e devolve a nota de cada avaliação — que é exatamente o insumo da média, da abertura da régua, das notas no extremo e da contagem de avaliados. Duas pegadinhas: só quem tem a permissão de administrar desempenho enxerga o ciclo inteiro (sem ela, a chamada devolve as avaliações que a própria pessoa escreveu, mais as de subordinados se ela for gestora), e o limite padrão é de 50 registros — um ciclo maior que isso trunca em silêncio se você não pedir mais. Nenhuma tela hoje mostra nota ao lado da identidade de quem avaliou: o painel de relatórios entrega distribuição e quartil por pessoa avaliada, e o ranking que ele tem por avaliador conta avaliações concluídas, não notas. Agrupar nota por avaliador é, hoje, trabalho de planilha em cima da API. - O número 6 tem tela, e ela já está no formato certo. O acompanhamento de conclusão do ciclo agrupa departamento → avaliador → pessoas avaliadas, que é a árvore da pré-leitura. O que ele não traz é nota — só situação de envio, que é justamente para o que serve a coluna 6.
- O número 5 não tem como sair do produto. Nada classifica um comentário como tendo evidência datada. É leitura humana, e a pré-leitura tem de reservar tempo para ela.
- Quando o caso desce para o nome, o resumo por pessoa no ciclo mostra a nota ponderada e a quebra por relação — mas só para quem administra o ciclo ou é o gestor direto daquela pessoa. Um avaliador que só é par não abre o resumo de quem não é subordinado dele.
- A ata não tem lugar no produto — guarde-a onde guarda as decisões de ciclo. E o módulo de desempenho não tem interruptor de funcionalidade: quem o vê é quem tem a permissão.
Três indicadores para medir a própria calibração
Se a calibração de avaliação de desempenho muda notas, ela é uma intervenção — e uma intervenção sem medida é fé. Três números, calculados sobre o mesmo ciclo antes e depois da reunião, dizem se a mesa fez o trabalho dela ou outro. São baratos: saem de duas cópias da mesma planilha.
Para mostrá-los funcionando, o exemplo abaixo usa seis avaliadores com oito avaliados cada — 48 notas numa escala de 1 a 5 — e uma mesa que moveu oito delas. Todos os números foram calculados; é um exemplo construído, não uma empresa real.
| Indicador | Antes | Depois | Leitura |
|---|---|---|---|
| 1. Dispersão entre avaliadores desvio-padrão das médias por avaliador |
0,522 | 0,310 | Caiu 41%. É o objetivo da mesa, e foi cumprido: a distância entre a régua mais branda e a mais severa foi de 1,50 para 0,75 ponto. (Não confundir com a "abertura da régua" da pré-leitura, que é dentro de um avaliador; esta é entre avaliadores.) |
| 2. Dispersão dentro do conjunto desvio-padrão de todas as 48 notas |
0,736 | 0,577 | Caiu 22% — e esse é o custo. Sumiu a única nota 2, e as notas 5 caíram de nove para cinco. A centralidade do estudo de Demeré, Sedatole e Woods aparecendo num exemplo de oito ajustes. |
| 3. Assimetria dos ajustes movidas para baixo ÷ total de movidas |
50% — 8 de 48 notas movidas (16,7%), sendo 4 para baixo e 4 para cima | Cinquenta por cento é o valor neutro: metade para cada lado. Por isso a média geral ficou igual (3,854 antes e depois). O estudo de Demeré, Sedatole e Woods deu 80% (262 de 327) — é esse número que denuncia uma mesa que virou corte de orçamento. | |
Em telas estreitas, a tabela rola para o lado.
Os três juntos contam o que nenhum conta sozinho: o primeiro sobe de valor quando cai, o segundo é o preço disso, e o terceiro diz se o preço foi cobrado de todo mundo ou só de quem estava no topo. Indicador 1 parado e indicador 3 assobiando para um lado só não é calibração: é corte.
Uma advertência sobre o indicador 2. Ele cair um pouco é esperado — é o efeito mecânico dos extremos descrito lá atrás —, e nem sempre é perda: parte do que encolheu pode ter sido inflação de nota sem lastro. O que você não quer é não saber. Registre os três a cada ciclo, com a mesma definição: a série de três ou quatro ciclos vale mais que o número de um, pelo mesmo motivo que faz um programa de reconhecimento parar de ser medido pelo palco e passar a ser medido pela cobertura.
E deixe os três onde eles pertencem na sua taxonomia de números: são indicadores de acompanhamento, não resultados-chave — a diferença que separa um KPI de um KR. Servem para vigiar, não para bater. No dia em que "cair a dispersão entre avaliadores" virar meta da mesa, você terá inventado uma curva forçada nova, agora disfarçada de indicador.
A ata da mesa, escrita por inteiro
Se sobrar um artefato só desta leitura, que seja este. A ata cabe em uma página, é escrita durante a reunião — não depois — e é o que faz a mesa do ano que vem começar de algum lugar. Abaixo, uma sessão fictícia, do jeito que a ata deveria sair da sala.
Calibração · Ciclo 2026.2 · Diretoria de Clientes
- Presentes e réguas
- Seis avaliadores — A, B, C, D, E e F —, com oito avaliados cada, 48 notas ao todo. Médias na entrada: A 4,62 · B 4,38 · C 3,88 · D 3,75 · E 3,38 · F 3,12. Distância entre a régua mais branda e a mais severa: 1,50 ponto. Os seis são os gestores diretos das pessoas que avaliaram, e as 48 notas calibradas aqui são as de gestor. Um piloto de avaliação de pares roda em paralelo para dois avaliados; as pendências dele estão registradas abaixo.
- Decisões de régua
- Em todos os casos abaixo a lista inteira do avaliador foi relida contra a régua corrigida, e só as notas que cruzaram a fronteira se moveram.
- A (4,62): régua para cima. Base: em três casos a entrega descrita corresponde ao esperado do cargo e recebeu nota máxima. Três notas cruzaram e desceram. Nova média: 4,25.
- F (3,12): régua para baixo. Base: dois casos comparados com entregas equivalentes na área de C. Três cruzaram e subiram. Nova média: 3,50.
- B (4,38): régua levemente para cima, mesma base de A. Uma nota cruzou. Nova média: 4,25.
- C (3,88) e D (3,75): réguas alinhadas, nenhuma nota movida.
- Decisão de evidência (não é régua)
- Avaliador E (média 3,38), pessoa avaliada nº 31: outro participante trouxe o projeto de migração de abril, que o comentário original não citava — é o caso de "evidência desigual", não de régua deslocada, então o ajuste vale só para esta pessoa e a régua do avaliador E fica como está. Nova média do avaliador: 3,50, por efeito de uma nota só.
- Notas movidas, uma linha cada
- 1. Auditora nº 4 · avaliador A · de 5 para 4 · entrega corresponde ao esperado do cargo, sem escopo além dele · proposto pela mesa, aplicado por A.
2. Analista nº 9 · avaliador A · de 5 para 4 · mesma base · proposto pela mesa, aplicado por A.
3. Analista nº 12 · avaliador A · de 5 para 4 · mesma base · proposto pela mesa, aplicado por A.
4. Especialista nº 17 · avaliador B · de 5 para 4 · mesma base · proposto pela mesa, aplicado por B.
5. Analista nº 42 · avaliador F · de 3 para 4 · entrega equivalente à de duas pessoas nota 4 na área de C · proposto por C, aplicado por F.
6. Analista nº 44 · avaliador F · de 2 para 3 · idem, comparação com a área de C · proposto por C, aplicado por F.
7. Auditor nº 46 · avaliador F · de 3 para 4 · idem · proposto por C, aplicado por F.
8. Pessoa avaliada nº 31 · avaliador E · de 3 para 4 · projeto de migração de abril, ausente do comentário original · proposto por D, aplicado por E. - Casos não resolvidos
- Dois casos passaram de cinco minutos sem evidência suficiente e saíram sem alteração. Responsável por trazê-la: o gestor direto de cada um. Prazo: 21 de outubro, antes do fechamento do ciclo.
- Envios pendentes na véspera
- Três avaliações de pares do piloto não enviadas, afetando duas pessoas — outras duas, sem relação com os dois casos acima. As notas de gestor delas estão entre as 48 e foram tratadas como as outras; o que a mesa adiou foi a leitura da nota final dessas duas, que ainda vai se mexer sozinha quando os pares enviarem, porque o peso da relação de pares se redistribui. Nenhum par do piloto enviou até a véspera, então nenhum deles deu nota neste ciclo e, pela regra 1, nenhum estava na mesa; entram na próxima, se enviarem.
- Indicadores da sessão
- Notas movidas: 8 de 48 (16,7%) — 4 para baixo, 4 para cima, assimetria 50%. Dispersão entre avaliadores: 0,522 → 0,310. Dispersão dentro do conjunto: 0,736 → 0,577. Média geral: 3,854, inalterada. (As médias por avaliador são exatas em oitavos — 4,625, 4,375, 3,875, 3,750, 3,375, 3,125 — e aparecem aqui arredondadas com o desempate para o par mais próximo, que é o padrão do Python e da maioria das planilhas quando a metade é exata.)
- O que esta mesa não decidiu
- Promoção, aumento, desligamento e sucessão — as quatro da regra 6 do protocolo. A reunião de aplicação da régua de recompensa está marcada para 28 de outubro, com o material de faixas, e usará estas notas como insumo.
- Para o próximo ciclo
- A e F recebem, antes da abertura do próximo ciclo, os exemplos âncora de cada nível escritos para os cargos da área. A mesa registra que a causa provável do deslocamento é a ausência desses exemplos, não o julgamento de quem avaliou.
Leia a última linha de novo: é a única do documento que tenta impedir que a mesma reunião aconteça igual no ciclo seguinte. Uma calibração que só corrige notas conserta o sintoma todo semestre; uma que devolve a âncora ao avaliador conserta a causa uma vez. Escrever esses exemplos e treinar quem avalia é conteúdo com público, prazo e evidência — ou seja, uma trilha montada do fim para o começo, em que a evidência é a pré-leitura do ciclo seguinte. E a âncora não é conversa de corredor: é texto escrito nos itens da avaliação, o mesmo trabalho que faz uma avaliação de desempenho valer alguma coisa e que continua depois da nota, no feedback contínuo e no plano de desenvolvimento que sai dela.
Vinte minutos, ao vivo, com a Spire aberta
Sem slide: a gente digita as suas áreas e monta o ciclo de metas
O que a chamada entrega é concreto e é uma coisa só: abrimos a Spire, você dita as suas áreas e os objetivos que já existem escritos em algum canto, e o seu ciclo de metas sai de pé antes de desligarmos. O primeiro bloco da conversa é sobre a sua operação, não sobre a Spire — é ali que a mesa deste texto cabe. Não precisa preparar nada. Depois do formulário, respondemos em até um dia útil.
Fontes
- Talent Strategy Group, 2026 Performance Management Report (autoria de Zac Upchurch), publicado em fevereiro de 2026. Mais de 250 organizações responderam a uma pesquisa de benchmarking, com dados coletados em novembro e dezembro de 2025. Daqui saem os 84,7% que fazem reuniões de calibração, os 63,6% que entregam distribuição esperada, a divisão 34,1% forçada / 65,9% orientada, os 56,9% de escala de 5 pontos e a ligação com recompensa (7,1% sem ligação; 55,3% orientada; 18,4% direta; 19,1% discricionária). Ressalvas do próprio relatório: amostra autosselecionada, sujeita a viés de seleção e de resposta, e a "efetividade" que ele reporta é percebida pelo respondente, não medida em resultado — e é uma consultoria publicando sobre o mercado em que vende. A multiplicação 63,6% × 34,1% = 21,7% é deste texto.
- Korn Ferry, Tendências de RH — recorte brasileiro, reproduzido pela imprensa entre 17 de fevereiro e 31 de março de 2026; uma das reproduções informa 264 empresas brasileiras. Daqui sai só o número em que duas reproduções independentes concordam: 75% das empresas promovem calibração. Elas divergem em quase todo o resto — 87% × 89% de programa formal, 94% × 63% de acordo de metas, 79% × 69% de apuração — e uma nomeia o estudo como "Tendências de RH para 2024 e 2025". Sem edição nem período de campo consistentes, o número entra como retrato de prática, não como dado do ano, e nenhum outro dessa fonte foi usado.
- B. William Demeré, Karen Sedatole e Alexander Woods, "The Role of Calibration Committees in Subjective Performance Evaluation Systems", versão de trabalho de maio de 2015. Dados proprietários do departamento de auditoria interna de uma multinacional: 1.333 notas de 686 profissionais, dadas por 110 supervisores distintos e passadas por 12 comitês de calibração, referentes a 2007, 2008 e 2009. Daqui saem os 327 ajustes (24,5%), a divisão 262 para baixo e 65 para cima, a média de 3,559 para 3,511, o desvio de 0,590 para 0,552 e as razões de chances: 3,051 (p < 0,01) para ajustar uma nota alta extrema contra uma nota do meio, e 0,711 (p > 0,10, sem significância estatística — indistinguível de "nenhuma diferença") para ajustar uma nota baixa extrema. Os 246 e os 66 são da nota de rodapé 10 do artigo, que classifica 312 notas como extremas. Ressalva: uma organização, uma função, dados que hoje têm quase duas décadas. O estudo descreve uma multinacional com 22 escritórios pelo mundo e não publica recorte por país — não afirme nada sobre o Brasil a partir dele. Não é benchmark; é o melhor registro medido de comitês reais que encontrei.
- Gallup, "2% of CHROs Think Their Performance Management System Works", publicado em 6 de maio de 2024. Dois levantamentos que não compartilham amostra: 135 CHROs da Fortune 500 global, campo 26/06 a 08/07/2023 (daí os 2% que concordam fortemente que o sistema inspira melhora); e 18.665 trabalhadores dos Estados Unidos, campo 09 a 24/08/2023, margem de ±1,1 pp (daí os 22% que acham o processo justo e transparente). Ressalva: campo de 2023, população americana. Entra por ordem de grandeza — a distância entre o que a área que administra o processo acha dele e o que quem o recebe acha —, não como retrato do Brasil em 2026.
- O produto. Cada afirmação sobre a Spire nesta página foi lida na implementação do módulo de desempenho antes de ser escrita: régua padrão de 1 a 5, mínimo de dez caracteres de comentário, anonimato do avaliador por padrão, pesos de 33,33 / 33,33 / 33,34, recusa de edição a quem não é o autor, bloqueio após a data de fim do ciclo, entrega ao avaliado só depois de todos os envios, redistribuição do peso quando falta uma relação, eixo de 9Box por tópico com o padrão ambos, colocação das caixas por terço de posto e a inferência do potencial no caso raro em que todos os tópicos são só de desempenho.
Perguntas frequentes
Calibração de avaliação de desempenho e curva forçada são a mesma coisa?
Não, e confundir as duas é o erro mais comum do tema. Calibração é o trabalho de alinhar a régua de avaliadores diferentes para que a mesma nota signifique a mesma coisa. Curva forçada é a obrigação de encaixar um percentual fixo de pessoas em cada faixa. Dá para calibrar sem nenhuma distribuição, e dá para forçar uma curva sem calibrar nada. Na amostra da Talent Strategy Group, 84,7% fazem calibração e cerca de 21,7% forçam a curva — a maioria das mesas de calibração, portanto, funciona sem cota.
Quanto tempo leva uma reunião de calibração?
Cerca de uma hora para até cinquenta avaliados — meia hora de réguas mais cinco minutos por caso que descer para o nome —, se a pré-leitura chegou com quarenta e oito horas de antecedência e o cronômetro for respeitado. Sem pré-leitura, a mesma mesa leva três ou quatro horas e termina sem decidir, porque o grupo passa o tempo reconstruindo números que já existiam.
Quantas notas uma boa calibração deveria mudar?
Não existe alvo, e transformar isso em meta é uma armadilha. O único registro medido que este texto encontrou traz 24,5% de notas ajustadas em doze comitês de uma organização — um retrato, não uma referência. Mais informativo que a taxa é a direção: nesse mesmo estudo, para cada nota que os comitês subiram eles desceram quatro, e a chance de uma nota alta extrema ser mexida era três vezes a de uma nota do meio, enquanto a de uma nota baixa extrema não era maior que a do meio. Acompanhe a série da sua empresa nas duas dimensões: se a taxa de movimentação subir ciclo após ciclo, o problema está nas âncoras do formulário; se a assimetria ficar parada num lado só, o problema está na mesa.
O comitê pode mudar a nota sem falar com quem avaliou?
Não deveria: quem conversa com a pessoa avaliada é o gestor, e defender uma nota que ele não escreveu é insustentável. Na Spire isso é também restrição técnica — a edição é recusada para quem não é o avaliador daquela atribuição, inclusive administradores. A mesa decide e o avaliador reescreve.
Como calibrar quando a empresa tem times de três ou quatro pessoas?
Não calibre dentro do time: junte os avaliadores de uma diretoria ou de uma função inteira na mesma mesa. A calibração compara réguas de avaliadores, e comparar réguas exige mais de um avaliador e gente suficiente para que a média de cada um signifique alguma coisa. Uma média sobre três avaliados é ruído — é o quarto número da pré-leitura existindo justamente para lembrar disso. E refaça a lista de avaliadores a cada ciclo em vez de copiar a anterior: em time pequeno, uma contratação já muda quem senta na mesa.
Autoavaliação entra na calibração?
A nota que a pessoa dá a si mesma não é calibrada: ela não é uma régua que a empresa administra, e ajustá-la é dizer a alguém que ele se avaliou errado. O que entra na mesa é a distância entre a autoavaliação e a nota do gestor, e ela é um sinal útil — uma distância grande e sistemática em um mesmo avaliador costuma indicar que o esperado nunca foi dito em voz alta, o que é assunto de 1:1 e não de comitê.
Calibração se aplica a OKR também?
Não da mesma forma. Um resultado-chave tem partida, chegada e data escritas antes, então a "nota" dele é uma medição, não um julgamento — o que se calibra em OKR é a ambição dos alvos na hora de escrevê-los, não o resultado na hora de fechar. Quando o dono do objetivo é um grupo e não uma pessoa, a pergunta muda outra vez. Misturar as duas coisas — calibrar o atingimento de meta numa mesa de comitê — é o caminho mais curto para ninguém mais escrever meta ambiciosa.
E se a mesa concluir que um gestor inteiro avaliou mal?
São duas decisões, e não são a mesma. A primeira é o que fazer com as notas deste ciclo: o ajuste de régua da regra 4, que vale para toda a lista daquele gestor. A segunda é o que fazer com o gestor, e essa não é do comitê — é de quem o lidera, com treinamento e exemplos âncora antes do ciclo seguinte. A Talent Strategy Group observa que treinamento obrigatório de gestão de desempenho está fortemente associado a melhor resultado percebido e continua incomum.


