Plano de teste A/B
Transforma uma hipótese de otimização em um plano de teste A/B executável: hipótese no formato problema, mudança e resultado esperado; métrica primária e métricas de guarda; tamanho de amostra e duração mínima calculados; critério de parada e regra de decisão; QA antes de publicar; e o registro do resultado. Use quando pedirem plano de teste A/B, quanto tempo rodar um teste, tamanho de amostra, hipótese de CRO, experimento de conversão ou como declarar o vencedor.
Instalar
Escolha o agente. O comando coloca a skill na pasta de usuário, válida em todos os seus projetos.
npx @conecto.cc/cli add plano-de-teste-ab~/.claude/skills/plano-de-teste-ab/ e cole o arquivo como SKILL.md.Plano de teste A/B
Quando usar
Use quando já existe uma hipótese (de auditoria, pesquisa ou dado) e a pergunta é "como
testar isso direito". Não use para escolher o que testar (a skill auditoria-cro-landing-page
faz isso) nem quando a página tem menos de 100 conversões por mês: nesse volume o teste não
fecha em prazo útil, e a saída é implementar a mudança e comparar antes e depois, ou fazer
pesquisa qualitativa.
O que você precisa
- Números da página nos últimos 30 dias: visitantes por semana, conversões por semana e a taxa de conversão atual (a linha de base).
- A hipótese e a mudança concreta que a variante vai ter. Se a mudança não cabe numa frase, são duas hipóteses.
- O menor efeito que vale a pena para o negócio (efeito mínimo detectável): "só vale implementar se subir a conversão pelo menos 15%". Isso vem do custo de implementar e do valor da conversão.
- A ferramenta de teste disponível e como ela divide o tráfego (no navegador, no servidor, por cookie). O GA4 não roda teste; precisa de ferramenta própria ou de bandeira de recurso no código.
- Métricas de guarda: o que não pode piorar (receita por visitante, qualidade do lead, rejeição, erros).
Passo a passo
Escreva a hipótese no formato: "Porque observamos [dado], acreditamos que [mudança] para [público] vai [resultado], medido por [métrica primária]." Sem o dado inicial, é opinião.
Escolha uma métrica primária e só uma, a mais próxima do dinheiro que a página consegue mover. Liste as métricas de guarda e as secundárias à parte; elas explicam, não decidem.
Calcule a amostra por variante para 95% de confiança e 80% de poder. Aproximação:
n = 15,7 × p × (1 - p) / (p × efeito)², compa taxa de conversão de base eefeitoo aumento relativo esperado. Referência de visitantes por variante:Taxa de base Efeito de 10% Efeito de 20% Efeito de 30% 2% 77.000 19.000 8.500 5% 30.000 7.500 3.300 10% 14.000 3.500 1.600 Confirme numa calculadora de amostra antes de publicar o plano.
Converta em duração: amostra total dividida pelos visitantes semanais da página que entram no teste. Arredonde para semanas inteiras, mínimo 2 (o comportamento muda entre dia de semana e fim de semana), máximo 6 (cookies expiram e o mesmo visitante vira dois). Se passar de 8 semanas, aumente o efeito mínimo, teste uma mudança maior ou não teste.
Fixe a regra de parada antes de começar: data de fim, amostra alvo, e o que se faz se o resultado for inconclusivo (implementa a mais barata, ou testa outra coisa). Olhar o resultado no meio e parar quando "deu significativo" é a forma mais comum de declarar vencedor falso.
Planeje o QA: variante renderiza em todos os navegadores e tamanhos de tela; não há piscada da versão original antes da variante; a métrica primária dispara nas duas versões; tráfego interno excluído; nenhum outro teste rodando na mesma página; nenhuma promoção ou feriado dentro da janela.
Prepare o registro do resultado já no plano: efeito observado com intervalo de confiança, métricas de guarda, segmentos (dispositivo, origem), decisão e aprendizado. Teste sem registro se perde em 3 meses e alguém propõe o mesmo de novo.
Formato da entrega
- Ficha do teste: nome, hipótese, página, público, variantes (descrição e captura), métrica primária, métricas de guarda, linha de base, efeito mínimo, amostra por variante, duração em semanas, datas de início e fim, ferramenta, responsável.
- Cálculo: os números usados e o resultado, para alguém conferir.
- Regra de decisão: o que acontece se a variante vence, perde ou empata.
- Checklist de QA com espaço para marcar cada item e quem conferiu.
- Modelo de registro do resultado, preenchido ao final.
Critérios de qualidade
- Uma métrica primária. As outras estão em listas separadas.
- Amostra e duração aparecem com o cálculo, não só o resultado.
- Duração em semanas inteiras, entre 2 e 6.
- A hipótese cita o dado que a motivou.
- Se o teste não é viável no volume atual, o plano diz isso e propõe a alternativa.
Armadilhas
- Parar cedo porque "já deu 95%". Com espiadas diárias, a chance de um falso vencedor passa de metade.
- Pescar métrica: a primária não moveu, mas "cliques no botão subiram". Cliques não eram a pergunta.
- Testar em semana atípica (Black Friday, lançamento, queda do site) e generalizar.
- Mudança pequena em página com pouco tráfego: o teste precisaria de meses para detectar o efeito.
- Ignorar segmentos que se anulam: variante ganha no celular e perde no desktop, e a média diz "empate".
- Tratar empate como derrota. Empate diz que a mudança não importou: implemente a mais barata e siga para uma hipótese maior.
- Rodar dois testes na mesma página ao mesmo tempo sem desenho para isso.