DESEMPENHO · FERRAMENTA

Avaliação 360 graus: quantos avaliadores chamar, quanto pesa cada um e como calcular a nota

Numa avaliação 360, a maior parte da nota vem de quem avalia, não de quem é avaliado. Quantos pares tornam a média confiável, quanto a autoavaliação deve pesar e uma calculadora para testar os pesos do seu ciclo.

29 min de leitura

A promessa da avaliação 360 graus é a visão completa: em vez de uma pessoa só julgar o seu trabalho, várias pessoas olham de lados diferentes, e o retrato fica mais justo. A promessa é boa. O que quase ninguém conta é o que os maiores estudos sobre o tema mostram quando separam as notas: a maior parte da variação de uma nota de desempenho vem de quem avalia, não de quem é avaliado. Cada avaliador enxerga uma versão diferente da mesma pessoa. A 360 funciona quando junta avaliadores suficientes para essas versões se compensarem, e isso não é questão de gosto. É conta.

Este texto faz essa conta. Ele mostra quantos pares uma média precisa para ser confiável, quanto cada fonte merece pesar na nota final, o que acontece quando uma fonte não responde e quem deve escolher os avaliadores. No meio há uma calculadora em que você testa os pesos do seu próprio ciclo com as notas de uma pessoa. No fim está a ficha técnica de um ciclo 360 já preenchida.

Diagrama com a pessoa avaliada no centro e quatro fontes de avaliação ao redor, cada uma com um número publicado em meta-análise. Gestor: confiabilidade média de 0,50 entre dois gestores que avaliam a mesma pessoa. Pares: 0,37. Liderados: 0,30. Autoavaliação: correlação de 0,22 com a nota do gestor, que mede concordância e não confiabilidade. Abaixo, uma faixa: em dois grandes conjuntos de dados, 62% e 53% da variação das notas vieram do efeito particular de cada avaliador, contra 21% e 25% vindos do desempenho de quem foi avaliado.

Quem olha, e quanto duas pessoas da mesma fonte concordam entre si

Confiabilidades entre avaliadores: Conway & Huffcutt (1997), meta-análise de avaliações de múltiplas fontes. Autoavaliação × gestor: Heidemeier & Moser (2009), 115 amostras. Barras: Scullen, Mount & Goff (2000), dois conjuntos de gestores (n = 2.350 e 2.142) avaliados por sete pessoas cada; o restante é erro aleatório e efeito da posição de quem avalia. Numa escala em que 1 seria concordância total, dois pares olhando a mesma pessoa concordam 0,37.

A avaliação 360 em 2026: menos comum do que parece, e mais cara com ciclos curtos

Dois levantamentos deste ano ajudam a situar a prática, e nenhum deles é brasileiro — procuramos pesquisa nacional de 2025 ou 2026 com números sobre 360 e não achamos uma que publicasse metodologia.

Pares e liderados aparecem em cerca de uma em cada três organizações pesquisadas. O 2026 Performance Management Report da Talent Strategy Group, publicado em fevereiro de 2026 com mais de 250 organizações e campo em novembro e dezembro de 2025, registra que 89% exigem que a conversa de desempenho inclua a visão do gestor, enquanto pares e liderados entram em cerca de um terço delas. O mesmo relatório observa que essas duas fontes vêm associadas a ganhos apenas marginais na efetividade percebida, "apesar da complexidade maior de executar". É uma amostra autosselecionada, sem recorte por país, e a efetividade é a que os próprios respondentes percebem — já usamos esse relatório no texto sobre como rodar o comitê de calibração, e a ressalva vale igual aqui.

A frequência está subindo, e com ela a conta de quem avalia. O 2027 State of People Strategy Report da Lattice, divulgado em 9 de setembro de 2026 a partir de 1.358 profissionais de RH (campo de 2 de abril a 11 de junho de 2026; 65% nos Estados Unidos, 17% no Reino Unido e 8% cada na França e na Alemanha), mostra que 33% das organizações já avaliam trimestralmente e 12% mensalmente — a fatia mensal triplicou desde 2025. A Lattice vende software de desempenho, e o relatório não traz números de 360. Mas a consequência é direta: um ciclo que pede cinco pares por pessoa quatro vezes por ano pede vinte formulários por pessoa avaliada por ano, e alguém preenche cada um.

Junte os dois e a leitura é esta: a 360 não é o padrão, dá trabalho, e quem a adota sem desenho paga o custo sem colher o ganho. A resposta não é desistir da visão de pares. É parar de tratá-la como um formulário a mais e começar a tratá-la como um instrumento de medida, com número mínimo de leituras, pesos declarados e uma finalidade escolhida antes do convite. E ela vem depois do básico: se a empresa ainda não tem ciclo, régua e conversa de desempenho funcionando, o ponto de partida é o guia prático de avaliação de desempenho, não a 360.

O que uma nota de 360 mede: a pessoa avaliada ou quem avalia?

Em 2000, Steven Scullen, Michael Mount e Maynard Goff publicaram no Journal of Applied Psychology uma das análises mais citadas sobre o assunto. Eles pegaram dois grandes conjuntos de gestores norte-americanos — 2.350 num, 2.142 no outro — em que cada pessoa tinha sido avaliada por sete avaliadores: dois chefes, dois pares, dois liderados e ela mesma. Com sete olhares sobre a mesma pessoa, dava para separar de onde vinha a variação das notas.

O resultado virou referência: o efeito particular de cada avaliador respondeu por 62% da variação das notas num conjunto e por 53% no outro. O desempenho de quem era avaliado — geral e por dimensão, somados — respondeu por 21% e 25%, menos da metade. O restante ficou com o erro aleatório e com um efeito pequeno da posição de quem avaliava, que os autores encontraram nas notas de chefes e liderados, mas não nas de pares.

Um estudo anterior do mesmo grupo (Mount e colegas, 1998, com 2.350 gestores) já apontava o detalhe que muda o desenho de um ciclo: o efeito de método estava ligado mais a cada avaliador individual do que ao nível dele. Traduzindo: os dois pares de uma mesma pessoa não formam um bloco com uma opinião de "pares". Cada um é uma régua própria, com a sua generosidade, a sua severidade e a sua história com quem está sendo avaliado.

A consequência prática cabe numa frase: uma nota isolada fala mais de quem a deu do que de quem a recebeu. É por isso que a 360 só funciona como média. O efeito particular de cada avaliador não some quando você pede mais cuidado a ele; ele se dilui quando você junta avaliadores suficientes para as réguas próprias se compensarem. A pergunta de desenho deixa de ser "quem conhece melhor esta pessoa?" e passa a ser "quantas leituras independentes eu preciso para que a média pare de depender de uma delas?".

Duas ressalvas. Os dados de Scullen vêm de avaliações para desenvolvimento, não para decisão de salário ou promoção, e de gestores dos Estados Unidos. E é razoável esperar que o efeito do avaliador pese mais justamente onde a 360 costuma ser aplicada — em competências comportamentais, que cada um observa num pedaço diferente da semana — do que numa métrica de entrega, com número conferível. É um dos motivos para a 360 medir comportamento e deixar resultado para o ciclo de metas.

Quantos pares chamar numa avaliação 360: a conta que decide o tamanho do ciclo

Se duas pessoas da mesma fonte concordam, em média, 0,37 (o número dos pares na meta-análise de Conway e Huffcutt, de 1997), quanto concordaria a média de três, cinco ou oito pares com a média de outro grupo do mesmo tamanho? A psicometria responde isso há mais de um século com a fórmula de Spearman-Brown:

confiabilidade da média de k avaliadores = k × r1 + (k − 1) × r

em que r é a concordância entre dois avaliadores da mesma fonte. Com r = 0,37 e k = 5: 5 × 0,37 = 1,85; 1 + 4 × 0,37 = 2,48; 1,85 ÷ 2,48 = 0,746.

A tabela abaixo roda a mesma conta de um a dez pares. A terceira coluna responde a uma pergunta mais concreta: se um único par der uma nota dois pontos abaixo dos outros — alguém que teve um atrito com a pessoa na semana anterior, por exemplo —, quanto a média de pares desce?

Tabela com o número de pares, de 1 a 10, a confiabilidade estimada da média de pares pela fórmula de Spearman-Brown com concordância de 0,37 entre dois pares, e quanto a média desce quando um único par dá uma nota dois pontos abaixo dos demais.
ParesConfiabilidade da médiaUm par 2 pontos abaixo move a média emLeitura
10,372,00Uma opinião, não uma média
20,541,00Já supera a de um único gestor (0,50), mas sem anonimato: cada par sabe o que o outro deu
30,640,67O mínimo para preservar o anonimato
40,700,50Passa de 0,70
50,750,40Faixa recomendada
60,780,33Faixa recomendada
70,800,29Passa de 0,80; cada par a mais agora compra pouco
80,820,25Ganho de 0,02 por par
90,840,22Idem
100,850,20O dobro de formulários de cinco, para 0,10 a mais

A curva conta a história inteira. Do primeiro ao quarto par, cada pessoa a mais compra muito: a confiabilidade sobe de 0,37 para 0,70 e o estrago de um avaliador fora da curva cai de dois pontos para meio. Do sétimo em diante, cada par compra quase nada e custa o mesmo formulário. Entre quatro e seis pares por pessoa avaliada é onde o ganho de medida ainda paga o tempo de quem preenche. Duas contas de bolso saem da mesma fórmula: para a média de pares chegar a 0,70, são quatro pares (3,97, arredondado para cima); para chegar a 0,80, sete.

Três é o piso por outro motivo. Com dois pares, o anonimato é ficção: cada um sabe o que deu e, vendo a média, deduz a nota do outro. O guia da Comissão de Serviço Público do governo do Canadá para os ciclos 360 da administração federal crava o mínimo de três avaliadores por categoria — pares, liderados e outros — "para garantir o anonimato", e descreve um processo típico com dez a doze avaliadores no total. Bracken, Rose e Church, num ensaio de 2016 sobre a prática, registram a mesma convenção: notas de pares e de liderados são quase sempre protegidas exigindo pelo menos três avaliadores por grupo. Pesquisa de clima é outro instrumento, com outro corte: no texto sobre clima e eNPS, o exemplo de recorte por área usa um mínimo de cinco respostas.

O que essa conta não diz. Spearman-Brown supõe que os avaliadores são intercambiáveis e que os erros deles não andam juntos. Pares do mesmo time, que almoçam juntos e compartilham a mesma impressão de um episódio, erram juntos — e aí cinco pares valem menos que cinco leituras independentes. A fórmula também mede concordância, não acerto: cinco pessoas podem concordar sobre uma impressão errada. E os números de base variam entre estudos. Uma meta-análise de 2024 (Zhou, Sackett, Shen e Beatty, 132 amostras) estimou a concordância entre dois gestores em 0,65, acima do 0,50 da tabela, e os autores desaconselham usar uma média geral única. Mesmo com esse número mais alto, quatro pares (0,70) empatam com um gestor sozinho ou o superam por pouco. Use a tabela para decidir a ordem de grandeza — três, cinco ou dez —, não para escrever uma casa decimal num relatório.

Quanto pesa cada fonte na nota da avaliação 360

Quase todo ciclo 360 começa com pesos iguais: um terço para a autoavaliação, um terço para o gestor, um terço para a média dos pares. É a escolha que ninguém precisa defender em reunião, e por isso mesmo quase nunca é discutida. Vale discutir, porque as três fontes não medem com a mesma qualidade, e a que mede pior é justamente a que mais puxa a nota para cima.

A meta-análise de Heidemeier e Moser (2009), com 115 amostras e 37.752 pessoas, encontrou correlação de 0,22 entre a autoavaliação e a avaliação feita pelo gestor. E, nas amostras ocidentais, as autoavaliações saíram sistematicamente mais generosas, com diferença de 0,32 desvio-padrão. Conway e Huffcutt acharam números da mesma família para autoavaliação × pares (0,19). A autoavaliação é informação valiosa — sobre o que a pessoa acha que entregou, sobre o que ela acha que se espera dela —, mas é informação de outra natureza. Ela mede percepção de si, não desempenho, e a distância entre ela e as outras fontes é o dado mais útil que ela traz.

Para ver o efeito, siga uma pessoa do exemplo deste texto. Caio é analista sênior, e todos os números abaixo são de um exemplo MODELO, construído para ser conferível à mão.

Exemplo MODELO · escala de 1 a 5 · as notas já são a média dos tópicos de cada formulário

Autoavaliação
4,5
Gestor
3,5
Cinco pares
3,8 · 4,2 · 3,0 · 3,6 · 4,0
Média dos pares
18,6 ÷ 5 = 3,72
Tabela com três esquemas de peso aplicados às notas do Caio: pesos iguais, 33,33, 33,33 e 33,34 por cento, resultam em 3,91; autoavaliação 10, gestor 40 e pares 50 resultam em 3,71; autoavaliação zero, gestor 45 e pares 55 resultam em 3,62. A penúltima coluna mostra a conta de cada esquema.
EsquemaAuto · Gestor · ParesContaNota final
Pesos iguais33,33 · 33,33 · 33,34(4,5 × 33,33 + 3,5 × 33,33 + 3,72 × 33,34) ÷ 1003,91
Autoavaliação como sinal10 · 40 · 50(0,45 + 1,40 + 1,86)3,71
Autoavaliação fora da nota0 · 45 · 55(1,575 + 2,046)3,62

Com pesos iguais, Caio termina com 3,91. Tirando a autoavaliação da conta, 3,62. Os 0,29 ponto de diferença vêm quase inteiros da nota que ele deu a si mesmo (só 0,01 vem da troca de meio a meio para 45 · 55 entre gestor e pares) — e 0,29 ponto numa escala de 1 a 5 é distância suficiente para trocar uma pessoa de faixa numa matriz de mérito ou de caixa na 9Box. Num time em que metade das pessoas se avalia com generosidade e a outra metade com modéstia, os pesos iguais premiam a generosidade.

O segundo detalhe é o peso relativo entre gestor e pares. Pela tabela da seção anterior, a média de cinco pares tem confiabilidade de 0,75, e a nota de um único gestor, 0,50. Dar ao gestor mais peso que aos cinco pares juntos é dar mais peso à leitura menos estável. Há boas razões para o gestor pesar muito — ele responde pela decisão, conhece o contexto das metas, viu o ano inteiro —, mas elas são razões de responsabilidade, não de medida. Declare qual das duas você está usando.

Regra 1

A autoavaliação entra como sinal, com no máximo 10% — ou fora da nota. O lugar dela é a conversa: a distância entre o que a pessoa acha e o que os outros viram é a pauta da devolutiva.

Regra 2

A média dos pares pesa pelo menos tanto quanto o gestor. Com três pares ela já é uma leitura mais estável (0,64) que a de um gestor sozinho (0,50); com cinco, bem mais (0,75).

Regra 3

Liderados formam um grupo próprio, com o mesmo mínimo de três. Misturados aos pares, viram outra média — e somem.

Regra 4

Os pesos são publicados antes do convite. Peso escolhido depois de ver as notas é ajuste de resultado.

A regra 3 merece o exemplo. Suponha que, dos cinco "pares" de Caio, dois sejam na verdade pessoas que respondem a ele — as notas 3,0 e 4,0. Os três pares laterais dão média 3,87; os dois liderados, 3,50. Misturados, 3,72. A média misturada não é a visão dos pares nem a dos liderados, e a informação mais útil para o desenvolvimento de quem lidera — como o time de baixo enxerga a liderança — desaparece dentro dela. Com dois liderados, aliás, não há como mostrar o grupo separado sem quebrar o anonimato; a saída honesta é chamar mais um ou deixar os dois de fora.

Calculadora da nota 360

Teste os pesos do seu ciclo com as notas de uma pessoa. A calculadora faz a mesma conta das seções anteriores: primeiro a média de cada fonte, depois a média ponderada entre as fontes. Se uma fonte ficar sem nota, o peso dela sai da conta e as outras são reescaladas — é o que a Spire faz, como a seção sobre ela mostra mais abaixo, e o efeito aparece na linha "peso efetivo". Ela também estima a confiabilidade da média de pares pela fórmula de Spearman-Brown. Os valores iniciais são os do Caio com pesos iguais; o resultado abaixo já está calculado, com ou sem JavaScript.

Pesos do ciclo (%)
Notas recebidas (escala de 1 a 5; deixe vazio a fonte que não respondeu)

Nota final

3,91

Média dos pares

3,72

5 pares

Confiabilidade da média de pares

0,75

Sem a autoavaliação

3,61

Peso efetivo: autoavaliação 33,3% · gestor 33,3% · pares 33,3%.

A autoavaliação passa dos 10% da nota final (regra 1).

Três testes que valem rodar nela. Apague as notas dos pares e veja o peso efetivo da autoavaliação saltar de um terço para metade: quando os pares não respondem, quem ganha peso é a nota que a pessoa deu a si mesma. Deixe só dois pares e veja o aviso de anonimato. E troque os pesos para 10 · 40 · 50: o aviso some e a nota cai 0,20 ponto sem nenhuma nota mudar. A conta de redistribuição, com dois colegas lado a lado e um par que não enviou, está no texto sobre calibração — é o motivo pelo qual uma mesa de calibração deveria abrir pela lista de envios pendentes.

Na última caixa, "sem a autoavaliação" reescala gestor e pares entre si, mantendo a proporção de peso entre os dois: com pesos iguais, 3,5 e 3,72 pesam metade cada e dão 3,61. A tabela da seção anterior usou 45 · 55, que é outro esquema, e por isso deu 3,62.

Quem escolhe os avaliadores

A composição da lista pesa tanto quanto o tamanho dela, e há três jeitos comuns de montá-la. Nenhum é neutro.

A pessoa avaliada escolhe

Ganha: ela indica quem de fato viu o trabalho, inclusive gente de outras áreas que o gestor não enxerga.

Perde: a tentação de indicar amigos é real, e a média sobe.

O gestor ou o RH escolhe

Ganha: controle sobre o equilíbrio da lista e sobre a carga de cada avaliador.

Perde: quem escolhe só enxerga as interações que acontecem na frente dele.

A pessoa indica, o gestor fecha

Ganha: a pessoa indica de seis a oito nomes; o gestor corta, completa e garante pelo menos um par com quem houve atrito ou discordância no período.

Perde: uma semana a mais no cronograma.

O terceiro formato é o que recomendamos, e o motivo é aritmético: como vimos, a média depende de os erros de cada avaliador não andarem juntos. Uma lista feita só de pessoas que gostam de quem é avaliado tem erros que andam juntos por construção. Duas regras de carga completam a lista: ninguém avalia mais de cinco ou seis pessoas no mesmo ciclo — na prática, a partir daí o formulário tende a virar preenchimento em lote — e todo avaliador deve ter convivido com a pessoa avaliada em pelo menos metade do período.

Clientes internos e avaliadores de outras áreas entram quando a função depende deles: um analista de RH que atende três departamentos, um líder técnico que trabalha com o time de produto. Eles formam um grupo próprio, com o mesmo mínimo de três, pela mesma razão dos liderados. E o formulário que cada grupo recebe deve ter só as perguntas que aquele grupo consegue responder — pedir a um par que avalie "cumprimento das metas individuais" é pedir um chute. Os tópicos de comportamento saem das competências da descrição de cargo, e não de uma lista genérica. O texto sobre entrevista estruturada mostra como escrever uma régua com âncoras de comportamento; a mesma técnica serve para cada tópico de uma 360.

Como montar um ciclo 360 na Spire

O módulo de desempenho da Spire foi desenhado em torno das três fontes, e cada decisão deste texto tem um lugar na tela de configuração do ciclo.

  • Pesos por ciclo. Em "Pesos das Avaliações", o administrador define quanto contribuem "Própria", "Gestor" e "Pares". O padrão é 33,33 · 33,33 · 33,34, e qualquer esquema da tabela acima cabe ali — inclusive a autoavaliação com peso zero. A tela avisa que os pesos são normalizados automaticamente e que, se um tipo de avaliador não tiver respostas, o peso dele é redistribuído: a mesma conta da calculadora.
  • A relação é preenchida sozinha. Ao criar as atribuições, a Spire marca cada avaliador como Líder, Par, Liderado ou Designado a partir da estrutura de áreas e de gestores cadastrada: Par é quem está na mesma área; um colega de outra área vira Designado. Na nota ponderada, porém, Liderado e Designado entram no mesmo grupo dos pares e dividem o peso de "Pares". Se a regra 3 importa para o seu ciclo, a leitura separada dos liderados é feita por fora da nota final.
  • Tópicos só para o gestor. Um tópico marcado como "Somente gestor" aparece na avaliação do gestor e fica oculto na autoavaliação e na de pares — o jeito de não pedir a um par o que ele não consegue ver. Atenção: avaliadores marcados como Liderado ou Designado ainda recebem esses tópicos.
  • Anonimato para quem é avaliado. Com "Anonimizar identidade dos avaliadores" ligado, que é o padrão, a pessoa avaliada vê "Avaliador 1", "Avaliador 2" ao lado das notas e dos comentários, com o tipo de relação. Gestor e administradores continuam vendo quem avaliou. Não existe um mínimo de avaliadores por grupo: com um único gestor, o tipo "Líder" já identifica a nota, e os três pares da seção anterior são uma regra que você aplica ao montar a lista — pelo mesmo motivo, a regra da ficha abaixo, de tirar da nota a média de pares com menos de três envios, é aplicada à mão, na calibração.
  • Resultado só no fim. A pessoa avaliada vê o resultado quando o ciclo encerra e todos os avaliadores terminaram — antes disso, a tela diz que os resultados ainda não estão disponíveis e mostra o andamento por tipo de avaliador. Uma avaliação que não chega segura a devolutiva de todo o resto; vale acompanhar as pendências nas últimas semanas.
  • Da nota à 9Box. Cada tópico declara se alimenta o eixo de desempenho, o de potencial ou os dois, e a 9Box usa a mesma média ponderada por fonte.
  • O agente de IA lê o resumo. A Roberta, o agente de IA nativo da Spire, consulta ciclos, avaliações recebidas e o resumo ponderado de quem a pessoa pode ver, e só envia uma avaliação depois de um cartão de aprovação.

Dois limites que convém saber antes de desenhar o ciclo. A lista de avaliadores é montada por quem administra o desempenho — a indicação pela própria pessoa avaliada, o formato recomendado acima, acontece numa conversa antes da atribuição, não num fluxo da ferramenta. E os avaliadores precisam ser pessoas ativas da empresa: cliente externo não entra.

Desenvolvimento ou decisão: escolha antes de convidar

A pergunta mais antiga sobre a 360 é se ela deve alimentar decisões — salário, promoção, desligamento — ou servir só para o desenvolvimento de quem é avaliado. Bracken, Rose e Church chamaram essa divisão de "o cisma profundo" do campo, no ensaio de 2016 publicado na Industrial and Organizational Psychology. A posição deles é equilibrada e útil: uma 360 cujos dados não são usados para nada é "só um evento", não um processo; e, ao mesmo tempo, há muitas situações em que ela não deve alimentar decisão por falta de preparo, de clima ou de apoio. O exemplo que eles citam são as Forças Armadas dos Estados Unidos, que usam a 360 para desenvolvimento, não para avaliação.

O conselho mais prático do ensaio é sobre a ordem: se existe a intenção de, um dia, usar a 360 para decisão, o conteúdo, o sistema e a comunicação têm de ser desenhados para isso desde o começo. Mudar a finalidade no meio muda o comportamento de quem avalia. Um par que escreveu com franqueza para ajudar um colega vai escrever diferente no ano seguinte, sabendo que aquilo pesou no aumento dele.

Tabela comparando uma avaliação 360 para desenvolvimento e uma para decisão em cinco dimensões: quem vê o relatório, o que acontece com a nota final, o papel dos comentários, a frequência e o que dá errado com mais frequência.
Para desenvolvimentoPara decisão
Quem vêA pessoa avaliada, e o gestor se ela quiserA pessoa, o gestor, o RH e o comitê
Nota finalPode nem existir: o relatório é a distância entre fontes, por tópicoExiste, com pesos publicados antes
ComentáriosO centro do relatórioEvidência que precisa ser específica e datada
FrequênciaAnual ou a cada mudança de papelJunto do ciclo formal
O que costuma dar erradoNinguém transforma o relatório em planoOs avaliadores inflam as notas para proteger colegas

A saída mais segura para quem está começando é a primeira coluna: um ou dois ciclos de 360 para desenvolvimento, com o relatório virando PDI — e, quando a lacuna for de habilidade, uma trilha de aprendizagem — e a conversa acontecendo na 1:1. Só depois, com as pessoas acostumadas a dar e receber a visão de pares — o que o feedback contínuo ao longo do ano facilita muito —, a média de pares entra na nota formal, com os pesos da ficha abaixo. Quando ela entra, entra também na régua de promoção como um dos insumos, nunca como o único.

Uma pesquisa da LiveCareer com mil trabalhadores, publicada pela SHRM em maio de 2025, dá a medida do risco de pular essa etapa: 79% disseram que deixariam de participar de avaliações 360 se pudessem, e 74% as consideram injustas, enviesadas ou imprecisas. É uma pesquisa de uma empresa de currículos, sem datas de campo publicadas, e serve como termômetro, não como estatística. Mas o termômetro aponta para a mesma coisa que os estudos: sem desenho, a 360 é vivida como um julgamento feito por pessoas que ninguém escolheu, com um peso que ninguém explicou.

A ficha técnica de um ciclo 360, preenchida

Tudo o que este texto defende cabe numa página. Esta é a ficha de um ciclo hipotético, de uma área de 40 pessoas, no primeiro ano em que a média de pares entra na nota formal. Troque os valores pelos seus, mas preencha todas as linhas antes de mandar o primeiro convite: cada linha em branco é uma decisão que alguém vai tomar sozinho no meio do ciclo.

Ciclo de desempenho · 2º semestre de 2026 · Área de Operações (40 pessoas) · exemplo MODELO

Finalidade
Decisão (mérito e promoção), depois de dois ciclos só de desenvolvimento. Comunicada no convite.
Fontes
Autoavaliação, gestor, pares. Liderados só para quem lidera três pessoas ou mais, lidos à parte.
Pesos
Autoavaliação 10 · gestor 40 · pares 50. Publicados no convite.
Pares por pessoa
Cinco. Mínimo de três enviados para a média entrar; abaixo disso, a nota usa só o gestor e o caso vai à calibração marcado.
Quem escolhe
A pessoa indica seis a oito nomes; o gestor fecha cinco, com pelo menos um de fora do círculo próximo.
Carga por avaliador
No máximo cinco avaliações de pares por pessoa no ciclo.
Formulário
Seis tópicos de comportamento com âncoras; dois tópicos só para o gestor (metas e entregas), que liderados e designados não devem receber.
Anonimato
Pares e liderados anônimos para a pessoa avaliada; o gestor vê os nomes e não os repassa.
Prazo
Três semanas para os formulários; pendências cobradas na segunda e na terceira semana.
Devolutiva
Na 1:1 seguinte ao fechamento, começando pela distância entre a autoavaliação e as outras fontes.
Calibração
Depois da devolutiva de pares e antes da matriz de mérito, com a lista de envios pendentes na primeira página.

Com esses números, a conta do ciclo fecha assim: 40 pessoas × 5 pares = 200 avaliações de pares, mais 40 autoavaliações e 40 de gestor, 280 formulários no total. Com a carga máxima de cinco por avaliador, cada pessoa da área avalia, em média, cinco colegas — no limite da regra, e por isso a ficha não pede seis pares. É o tipo de conta que decide se o ciclo cabe no calendário de rituais de gestão da empresa antes de o convite sair, e não depois que metade das pessoas desistiu no meio.

Perguntas frequentes

O que é avaliação 360 graus?

É uma avaliação de desempenho em que a mesma pessoa é avaliada por várias fontes — normalmente ela mesma, o gestor, pares e, para quem lidera, liderados —, com um formulário comum e as notas combinadas por fonte. A diferença para a avaliação tradicional não é o número de formulários: é que a nota passa a ser uma média de leituras independentes, e por isso depende de quantas leituras entram e de quanto cada fonte pesa.

Quantos avaliadores uma avaliação 360 deve ter?

De quatro a seis pares por pessoa avaliada é a faixa em que a média fica confiável sem sobrecarregar ninguém: com concordância de 0,37 entre dois pares, a confiabilidade da média passa de 0,70 com quatro e chega a 0,78 com seis. Três é o mínimo para preservar o anonimato de cada grupo. Somando gestor, autoavaliação e, quando houver, liderados, um ciclo típico fica entre seis e doze avaliadores por pessoa.

Quanto deve pesar a autoavaliação?

No máximo 10% da nota final, ou nada. A autoavaliação tem correlação de 0,22 com a nota do gestor e tende a ser mais generosa, então pesos iguais premiam quem se avalia com generosidade. O valor dela está na conversa de devolutiva: a distância entre o que a pessoa acha que entregou e o que os outros viram é o dado mais útil do relatório.

Como calcular a nota final da avaliação 360?

Primeiro a média de cada fonte (por exemplo, a média dos cinco pares), depois a média ponderada entre as fontes pelos pesos do ciclo. Se uma fonte não respondeu, o peso dela sai do denominador e os pesos das outras são reescalados. A calculadora deste texto faz a conta e mostra o peso efetivo de cada fonte depois da redistribuição.

A avaliação 360 deve ser anônima?

Para pares e liderados, sim, e o anonimato só existe de fato com pelo menos três avaliadores por grupo — com dois, cada um deduz a nota do outro. A nota do gestor normalmente não é anônima, e não precisa ser: ele responde pela conversa. Anonimato também exige cuidado com os comentários, que podem identificar quem escreveu pelo estilo ou pelo episódio citado.

Avaliação 360 serve para decidir aumento e promoção?

Pode servir, desde que isso seja desenhado e comunicado antes do primeiro ciclo. O mais seguro é começar com um ou dois ciclos só para desenvolvimento e levar a média de pares para a nota formal depois, com pesos publicados e como um insumo entre outros. Mudar a finalidade no meio do caminho muda o jeito como as pessoas avaliam.

Qual a diferença entre avaliação 360 e avaliação 180?

A avaliação 180 costuma combinar só autoavaliação e gestor; a 360 acrescenta pares e, para líderes, liderados. As contas deste texto mostram por que a diferença importa: a média de quatro ou cinco pares é uma leitura mais estável do que a de um único gestor, e sem ela a nota fica exposta ao efeito particular de uma pessoa só.

Fontes

  • Scullen, Mount & Goff (2000), "Understanding the latent structure of job performance ratings", Journal of Applied Psychology 85(6). Dois conjuntos de gestores dos EUA (n = 2.350 e 2.142), sete avaliadores por pessoa, avaliações para desenvolvimento. Efeito do avaliador: 62% e 53% da variação; desempenho do avaliado: 21% e 25%.
  • Mount, Judge, Scullen, Sytsma & Hezlett (1998), "Trait, rater and level effects in 360-degree performance ratings", Personnel Psychology 51(3). 2.350 gestores; o efeito de método está ligado a cada avaliador, mais do que ao nível dele.
  • Conway & Huffcutt (1997), "Psychometric properties of multisource performance ratings", Human Performance 10(4). Meta-análise; confiabilidade média entre avaliadores de 0,50 (gestores), 0,37 (pares) e 0,30 (liderados); autoavaliação × pares 0,19. Lido pelo resumo publicado.
  • Heidemeier & Moser (2009), "Self–other agreement in job performance ratings", Journal of Applied Psychology 94(2). Autoavaliação × gestor: r = 0,22 (115 amostras, 37.752 pessoas); leniência da autoavaliação em amostras ocidentais, d = 0,32.
  • Zhou, Sackett, Shen & Beatty (2024), "An updated meta-analysis of the interrater reliability of supervisory performance ratings", Journal of Applied Psychology. 132 amostras; concordância entre gestores de 0,65, com recomendação de não usar uma média geral única.
  • Talent Strategy Group, 2026 Performance Management Report, fevereiro de 2026. Mais de 250 organizações, campo em novembro e dezembro de 2025, amostra autosselecionada, sem recorte por país.
  • Lattice, 2027 State of People Strategy Report, 9 de setembro de 2026. 1.358 profissionais de RH, campo de 2 de abril a 11 de junho de 2026, maioria nos EUA; fornecedora de software de desempenho.
  • Public Service Commission of Canada, perguntas frequentes sobre os serviços de feedback 360°: mínimo de três avaliadores por categoria para garantir o anonimato; processo típico com 10 a 12 avaliadores.
  • Bracken, Rose & Church (2016), "The evolution and devolution of 360° feedback", Industrial and Organizational Psychology 9(4). Ensaio de praticantes, não estudo empírico.
  • SHRM, 5 de maio de 2025, reportagem sobre pesquisa da LiveCareer com 1.000 trabalhadores; fornecedora de serviços de currículo, sem datas de campo publicadas.
  • Excluído: o 0,42 de concordância entre pares que circula atribuído a Viswesvaran, Ones & Schmidt (1996). O artigo é fechado, o resumo publicado traz só o 0,52 dos gestores, e não conseguimos conferir o número dos pares na origem — por isso a tabela usa o 0,37 de Conway & Huffcutt.

Spire

Coloque essas ideias para rodar no seu RH

OKRs, avaliações de desempenho, 1:1, PDI e clima em uma única plataforma — com um agente de IA que ajuda a decidir.