Pergunta 46 de 50
O que acontece quando o Leader cai?
Pergunta
"O que acontece quando o broker que hospeda o Leader de uma Partition cai?"
O que o entrevistador quer avaliar
Se você sabe que a eleição é automática, vem especificamente do ISR (não de qualquer follower), e tem um custo real de indisponibilidade — não é transparente e instantâneo.
Resposta rápida
O controlador do cluster detecta a falta de heartbeat do broker e promove automaticamente um follower do ISR a novo leader daquela partition — sem intervenção manual. Producers e consumers recebem um erro transitório, redescobrem o novo leader automaticamente, e retomam a operação.
Resposta nível Sênior
O processo é automático, mas não instantâneo nem gratuito: durante a janela de detecção (heartbeat) e
eleição — tipicamente segundos em um cluster saudável — escritas e leituras daquela partition específica
ficam temporariamente indisponíveis. O novo leader é escolhido apenas entre as réplicas no ISR, nunca uma
réplica atrasada, justamente para não perder dados já confirmados a producers com acks=all. Do ponto de
vista da aplicação, isso se manifesta como uma latência elevada pontual, não como uma falha visível — desde
que a configuração de retry do client esteja correta.
Explicação aprofundada
Veja "O que acontece quando o Leader cai" no Capítulo 5.
Exemplo financeiro
Se o broker leader da partition que hospeda transações de um lote de contas cai durante um pico de tráfego, o cluster elege um novo leader em segundos — mas os producers desse intervalo podem sofrer uma latência elevada momentânea até a eleição terminar.
"A eleição de novo leader é instantânea e sem impacto perceptível"
Existe uma janela real de indisponibilidade da partition durante a detecção e eleição. Sistemas sensíveis a latência precisam considerar esse intervalo no orçamento de disponibilidade, não assumir failover como algo transparente.
Pode vir a seguir
Prováveis follow-ups: "o que é min.insync.replicas?" e "o que é Consumer Lag?".
Capítulos relacionados