TL;DR, Resposta rápida
7 min de leituraO tamanho de amostra para teste A/B é fixado antes do lançamento a partir de três dados: a taxa de conversão base, o efeito mínimo detectável e o poder estatístico exigido, geralmente 80%, com um nível de significância escolhido, geralmente 95%. Um teste que move uma base de 5% com um efeito mínimo detectável de 1 ponto percentual precisa de cerca de 8,146 visitantes por variante. Checar os resultados antes de esse número ser atingido e parar diante de uma virada favorável infla a taxa de falsos positivos além do nível de significância que o teste deveria manter.
Como calcular o tamanho de amostra para teste A/B?
Três dados definem o tamanho de amostra para teste A/B antes de um único visitante ver o teste: a taxa de conversão base, o efeito mínimo detectável e o poder estatístico exigido. Coloque esses três valores na fórmula do tamanho de amostra junto com um nível de significância escolhido, e a fórmula devolve o número de visitantes que cada variante precisa antes que o teste possa ser lido. Calcule esse número antes do lançamento, não depois que o teste já rodou uma semana e alguém quer uma resposta antecipada, e use-o para decidir a meta de uma boa taxa de conversão do teste antes de comparar o resultado com qualquer referência externa.
O que é a taxa de conversão base?
A taxa de conversão base é a taxa atual da métrica testada, medida na página antes de qualquer mudança entrar no ar, usando a mesma fórmula da taxa de conversão que a empresa já acompanha. Uma página de checkout que converte hoje a 5% é a base para um teste nessa mesma página, e a fórmula define qualquer outro dado em relação a esse número de partida. Retire a base de pelo menos duas a quatro semanas de tráfego típico, não de um único dia fora do padrão.

O que é o efeito mínimo detectável?
O efeito mínimo detectável é a menor mudança na taxa de conversão que o teste é construído para captar, expressa como a diferença entre a taxa base e a taxa alvo. Escolher um efeito mínimo detectável de 1 ponto percentual sobre uma base de 5% significa que o teste foi desenhado para detectar de forma confiável uma subida para 6%, e ele não vai captar de forma confiável um movimento menor como 5.3%. Um efeito mínimo detectável menor exige uma amostra maior, já que a fórmula precisa separar uma diferença menor do ruído aleatório.
O que significa poder estatístico em um teste A/B?
Poder estatístico é a probabilidade de o teste detectar um efeito real do tamanho escolhido, quando esse efeito realmente existe. Um poder de 80%, o padrão comum, significa que o teste perde um efeito real uma vez em cada cinco, então subir o poder para 90% capta mais efeitos reais, mas exige uma amostra maior para isso.
O que significa nível de significância em um teste A/B?
Nível de significância é a probabilidade de declarar um vencedor quando não há diferença real entre as variantes, geralmente fixado em 5%, o que corresponde a um nível de significância de 95%. Baixar essa taxa de falsos positivos para 1% torna o teste mais conservador e, assim como subir o poder, aumenta o tamanho de amostra necessário para chegar a um veredito, a mesma troca que também molda testes A/B em tráfego real de forma mais ampla.
Qual é a fórmula do tamanho de amostra?
A fórmula do tamanho de amostra combina a taxa base, a taxa alvo e os valores Z do poder e do nível de significância escolhidos em um único cálculo por variante.
n = (Z(1-alpha/2) + Z(1-beta))^2 x [p1(1-p1) + p2(1-p2)] / (p2 - p1)^2
Aplique em um teste de checkout. A taxa de conversão base p1 é 5% (0.05), a taxa alvo p2 é 6% (0.06) depois de um efeito mínimo detectável de 1 ponto percentual, a significância é 95% (Z = 1.96) e o poder é 80% (Z = 0.84).
| Dado | Símbolo | Valor |
|---|---|---|
| Taxa de conversão base | p1 | 5% |
| Taxa de conversão alvo | p2 | 6% |
| Efeito mínimo detectável | p2 menos p1 | 1 ponto percentual |
| Nível de significância | alpha | 5% (Z = 1.96) |
| Poder estatístico | beta | 80% (Z = 0.84) |
| Tamanho de amostra por variante | n | 8,146 visitantes |
(1.96 + 0.84)^2 = 7.84, e [0.05 x 0.95 + 0.06 x 0.94] = 0.1039. Dividir 7.84 x 0.1039 por (0.01)^2 dá 8,145.76, arredondado para 8,146 visitantes por variante, ou cerca de 16,292 no total entre as duas variantes. Reduzir o efeito mínimo detectável pela metade, para 0.5 ponto percentual, quadruplica aproximadamente esse número, já que o denominador eleva ao quadrado o tamanho do efeito.

- Uma única leitura, no número definido pela fórmula
- O nível de significância de 95% se mantém como planejado
- Um resultado conta como decisão
- Verificado diariamente por duas semanas: catorze chances de o ruído cruzar o limite
- A taxa real de falsos positivos acaba bem acima de 5%
- Uma virada favorável é informal, não um veredito
Por que olhar os resultados cedo demais quebra o cálculo do tamanho de amostra?
Olhar os resultados antes de o tamanho de amostra calculado ser atingido quebra o teste, porque cada olhada antecipada é uma nova chance de o ruído aleatório cruzar o limiar de significância. Um teste checado diariamente por duas semanas dá à variação aleatória catorze oportunidades separadas de produzir um falso positivo, então a taxa real de falsos positivos acaba bem acima dos 5% que o teste deveria manter, mesmo que cada checagem isolada tenha usado um limiar válido de 95%. Fixe o tamanho de amostra antes do lançamento, rode o teste até esse número sem checar um veredito no caminho, e use dados de funil e de metas para confirmar a taxa diária de tráfego necessária para chegar lá no prazo.
Perguntas frequentes
Que tamanho de amostra eu preciso para um teste A/B?
O tamanho de amostra depende da sua taxa de conversão base, do efeito mínimo detectável e do poder e nível de significância escolhidos, sem número fixo que sirva para todo teste. Um teste que move uma base de 5% em 1 ponto percentual com 80% de poder e 95% de significância precisa de cerca de 8,146 visitantes por variante.
O que é um bom efeito mínimo detectável?
Um bom efeito mínimo detectável é a menor mudança que ainda valeria a pena colocar no ar, não a menor mudança teoricamente possível de medir. Defini-lo pequeno demais força um tamanho de amostra grande demais; defini-lo grande demais deixa passar melhorias reais e menores sem que o teste as detecte.
Por que efeitos menores precisam de amostras maiores?
Efeitos menores precisam de amostras maiores porque a fórmula do tamanho de amostra eleva ao quadrado o efeito mínimo detectável no denominador, então reduzir o efeito pela metade quadruplica aproximadamente a amostra exigida. Um teste construído para captar um movimento de 0.5 ponto percentual precisa de cerca de quatro vezes mais visitantes do que um construído para captar 1 ponto percentual.
O que acontece se eu parar um teste A/B antes da hora?
Parar um teste A/B antes da hora, com base em um resultado que parece favorável antes de o tamanho de amostra calculado ser atingido, infla a taxa real de falsos positivos acima do nível de significância que o teste deveria manter. A confiança de 95% relatada deixa de refletir as chances reais de um vencedor falso assim que a equipe passa a checar os resultados e agir sobre eles repetidamente.
Flowsery
Teste gratuito
Painel em tempo real
Rastreamento de metas
Rastreamento sem cookies
Poder de 80% é sempre a escolha certa?
Poder de 80% é um padrão comum, não uma exigência, e significa que o teste perde um em cada cinco efeitos reais do tamanho escolhido. Subir o poder para 90% capta mais efeitos reais ao custo de um tamanho de amostra exigido maior.
Posso usar uma amostra menor se eu só quiser um sinal direcional?
Rodar abaixo do tamanho de amostra calculado para uma leitura direcional é possível, mas o resultado carrega uma chance bem maior de ser ruído, não uma versão menor da mesma confiança. Trate qualquer leitura feita antes de o tamanho de amostra alvo ser atingido como informal, e não a use para tomar uma decisão permanente.
Quanto tempo leva para atingir o tamanho de amostra necessário?
A fórmula devolve um número de visitantes, não um número de dias, então o prazo depende do tráfego que a página testada já recebe. Uma página de checkout que precisa de 8.146 visitantes por variante chega a esse número mais rápido em uma página com muito tráfego do que em uma com pouco. Olhar os dados de funil e metas antes do lançamento mostra se a taxa de tráfego diário atual consegue atingir a meta num prazo razoável.
Por que medir a base ao longo de duas a quatro semanas em vez de um único dia?
Um único dia pode sair incomumente alto ou baixo por motivos que não têm nada a ver com o teste, como um fim de semana fraco ou uma campanha de marketing. Duas a quatro semanas de tráfego típico suavizam essas variações e dão à fórmula uma taxa de conversão base que realmente representa a página. Todo outro valor da fórmula, incluindo a taxa alvo e o efeito mínimo detectável, é definido em relação a esse número de partida.
A fórmula do tamanho de amostra assume tráfego igual para cada variante?
A fórmula calcula n como o número de visitantes necessário por variante, e o exemplo do checkout aplica os mesmos 8.146 tanto ao controle quanto à variante, totalizando 16.292. Isso significa que o cálculo assume uma divisão igual do tráfego entre as duas versões comparadas. Um teste que envia tráfego desigual para cada variante não vai atingir os dois tamanhos de amostra ao mesmo tempo.
A taxa de conversão base pode vir de uma página diferente da que está sendo testada?
Não, a base precisa vir exatamente da página onde o teste vai rodar, medida na métrica para a qual essa página está sendo testada. Uma página de checkout que converte a 5% é a base para um teste nessa mesma página de checkout, não uma taxa emprestada de outra página ou outra métrica. Usar uma taxa de outro lugar quebra a relação de que a fórmula depende entre a base e a taxa alvo.
Este artigo foi útil?
Diga-nos o que pensa!
Veja-nos mais no Google
Um clique marca a Flowsery como fonte preferida e nossos artigos passam a aparecer mais acima nas suas Principais notícias, no modo IA e nas visões gerais com IA.
Antes de ir...
Flowsery
Analytics orientado para receitas para o seu site
Rastreie cada visitante, fonte e conversão em tempo real. Simples, poderoso e sem cookies.
Painel em tempo real
Rastreamento de metas
Rastreamento sem cookies
Termos relacionados do glossário


Como aplicar a fórmula do valor médio do pedido passo a passo
A fórmula do valor médio do pedido divide a receita total pelos pedidos, e um único cupom de desconto pode distorcer cada número que uma equipe reporta.


Onde a queda realmente acontece no funil de conversão
A conversão por etapa e a conversão geral respondem perguntas diferentes sobre o funil de conversão, e a diferença entre elas mostra onde a queda acontece.


A fórmula da taxa de conversão aplicada a tráfego real
A fórmula da taxa de conversão: conversões divididas por sessões ou visitantes únicos, vezes 100. Uma semana de tráfego pelos dois denominadores dá duas.


O que estes números revelam sobre a taxa de rejeição média por setor
Nove setores rastreados mostram uma taxa de rejeição média por setor documentada, entre 35.76% e 48.38%, segundo dados da Databox de setembro de 2024.


Ler bem uma curva de retenção começa pela análise de coortes
Uma curva de retenção só faz sentido quando a análise de coortes agrupa usuários por uma data de início compartilhada, já que uma média esconde esse padrão.


Dois números se escondem atrás de uma taxa de drop-off
Todo funil produz dois números de taxa de drop-off, um por etapa e outro de ponta a ponta, e as equipes citam os dois como se fossem o mesmo número.
Artigos relacionados


As escolhas de configuração por trás de toda análise de funil
Três escolhas de configuração decidem o que a análise de funil reporta: a ordem das etapas, a janela de conversão e se o funil conta usuários ou sessões.


Cinco formas de calcular net revenue retention com os mesmos dados
Uma fórmula de net revenue retention, cinco variantes defensáveis: a mesma coorte devolve 84.0%, 104.5%, 108.3%, 109.5% ou 110.3% conforme a janela e a base.


Como uma janela de atribuição decide quais pontos de contato recebem crédito
Mude a janela de atribuição de 7 para 90 dias e um pedido de $1,800 paga três conjuntos de canais diferentes. Veja a aritmética e os padrões das plataformas.

