Avaliação de desempenho
Vertentes em avaliação de desenvolvedores — entendendo a diferença entre modelos
O que cada modelo de avaliação de desenvolvedores incentiva e onde cada um falha.

Neste artigo
Em resumo
- Há cinco vertentes principais: ranking forçado, métricas de volume, frameworks de sistema (DORA e SPACE), avaliação por percepção e score absoluto com faixas de referência.
- Toda métrica molda comportamento: o time entrega aquilo que o modelo recompensa.
- O ranking forçado sempre cria um último colocado, métricas de volume são fáceis de inflar, DORA e SPACE medem o sistema e não indivíduos, e a percepção sofre vieses.
- Para escolher, a pergunta decisiva é: que comportamento este modelo incentiva?
Não existe um jeito único de avaliar desenvolvedores — existem vertentes, e cada uma otimiza uma coisa diferente. Antes de adotar um modelo, vale entender o que cada família incentiva na prática, porque toda métrica molda comportamento: o time entrega aquilo que o modelo recompensa.
Ranking forçado
O stack ranking compara pessoas entre si e distribui o time numa curva. O problema é estrutural: mesmo quando todo o time melhora, alguém continua em último. O modelo incentiva competição interna, desincentiva colaboração e pune equipes fortes — ficar na média de um time excelente vale menos que se destacar num time fraco.
Métricas de volume
Contar commits, linhas de código ou horas como medida direta de produtividade esbarra na Lei de Goodhart: quando a métrica vira meta, deixa de ser uma boa métrica. Volume é fácil de inflar — commits picados, código redundante, horas registradas sem critério — e o modelo passa a recompensar movimento, não valor.
Frameworks de sistema
Abordagens como DORA e SPACE medem o sistema de entrega: lead time, frequência de deploy, taxa de falhas, satisfação do time. São excelentes para diagnosticar gargalos organizacionais — mas foram desenhadas para não avaliar indivíduos. Elas não respondem às conversas que a gestão precisa ter: 1:1s, promoções, desenvolvimento de carreira.
Avaliação por percepção
Avaliações 360 e formulários de desempenho trazem contexto humano rico, mas sofrem de vieses conhecidos: recência (pesa o último mês, não o ciclo todo), proximidade (quem aparece mais é melhor avaliado) e halo (uma qualidade contamina a leitura das outras). Sozinha, a percepção transforma avaliação em popularidade.
Score absoluto com faixas de referência
A vertente do Devint combina as anteriores corrigindo suas falhas: sinais automáticos do fluxo real de trabalho, avaliações estruturadas de liderança e comparação com faixas saudáveis — não com colegas. Quando todo o time melhora, a melhora aparece como coletiva. E o teto de saturação desarma o gaming: acima da faixa, volume extra não aumenta pontuação.
Como escolher um modelo
A pergunta decisiva não é “qual modelo é mais preciso?”, e sim “que comportamento este modelo incentiva?”. Um bom teste:
- Se todo o time melhorar junto, o modelo mostra isso — ou fabrica um último colocado?
- Dá para melhorar o resultado inflando volume — ou existe teto?
- O modelo sustenta conversas individuais (1:1, promoção) — ou só diagnóstico de sistema?
- A leitura combina evidência objetiva com julgamento humano — ou depende só de um dos dois?
Para conhecer em detalhe a vertente que o Devint adota — dimensões, pesos e faixas — veja a metodologia completa.
Perguntas frequentes
Qual é o problema do ranking forçado (stack ranking)?
Mesmo quando todo o time melhora, alguém continua em último. O modelo incentiva competição interna, desincentiva colaboração e pune equipes fortes.
Por que contar commits, linhas de código ou horas não mede produtividade?
Pela Lei de Goodhart: quando a métrica vira meta, deixa de ser uma boa métrica. Volume é fácil de inflar, e o modelo passa a recompensar movimento, não valor.
DORA e SPACE servem para avaliar desenvolvedores individualmente?
Não. Eles medem o sistema de entrega e são excelentes para diagnosticar gargalos organizacionais, mas foram desenhados para não avaliar indivíduos.
Quais vieses afetam a avaliação por percepção?
Recência (pesa o último mês, não o ciclo todo), proximidade (quem aparece mais é melhor avaliado) e halo (uma qualidade contamina a leitura das outras).
Como escolher um modelo de avaliação de desenvolvedores?
Verifique se o modelo mostra a melhora coletiva, se tem teto contra volume inflado, se sustenta conversas individuais e se combina evidência objetiva com julgamento humano.