CROGA4v1.0.0

Plano de teste A/B

Transforma uma hipótese de otimização em um plano de teste A/B executável: hipótese no formato problema, mudança e resultado esperado; métrica primária e métricas de guarda; tamanho de amostra e duração mínima calculados; critério de parada e regra de decisão; QA antes de publicar; e o registro do resultado. Use quando pedirem plano de teste A/B, quanto tempo rodar um teste, tamanho de amostra, hipótese de CRO, experimento de conversão ou como declarar o vencedor.

Instalar

Escolha o agente. O comando coloca a skill na pasta de usuário, válida em todos os seus projetos.

$npx @conecto.cc/cli add plano-de-teste-ab
Ver o arquivoSem CLI: crie a pasta ~/.claude/skills/plano-de-teste-ab/ e cole o arquivo como SKILL.md.

Plano de teste A/B

Quando usar

Use quando já existe uma hipótese (de auditoria, pesquisa ou dado) e a pergunta é "como testar isso direito". Não use para escolher o que testar (a skill auditoria-cro-landing-page faz isso) nem quando a página tem menos de 100 conversões por mês: nesse volume o teste não fecha em prazo útil, e a saída é implementar a mudança e comparar antes e depois, ou fazer pesquisa qualitativa.

O que você precisa

  1. Números da página nos últimos 30 dias: visitantes por semana, conversões por semana e a taxa de conversão atual (a linha de base).
  2. A hipótese e a mudança concreta que a variante vai ter. Se a mudança não cabe numa frase, são duas hipóteses.
  3. O menor efeito que vale a pena para o negócio (efeito mínimo detectável): "só vale implementar se subir a conversão pelo menos 15%". Isso vem do custo de implementar e do valor da conversão.
  4. A ferramenta de teste disponível e como ela divide o tráfego (no navegador, no servidor, por cookie). O GA4 não roda teste; precisa de ferramenta própria ou de bandeira de recurso no código.
  5. Métricas de guarda: o que não pode piorar (receita por visitante, qualidade do lead, rejeição, erros).

Passo a passo

  1. Escreva a hipótese no formato: "Porque observamos [dado], acreditamos que [mudança] para [público] vai [resultado], medido por [métrica primária]." Sem o dado inicial, é opinião.

  2. Escolha uma métrica primária e só uma, a mais próxima do dinheiro que a página consegue mover. Liste as métricas de guarda e as secundárias à parte; elas explicam, não decidem.

  3. Calcule a amostra por variante para 95% de confiança e 80% de poder. Aproximação: n = 15,7 × p × (1 - p) / (p × efeito)², com p a taxa de conversão de base e efeito o aumento relativo esperado. Referência de visitantes por variante:

    Taxa de base Efeito de 10% Efeito de 20% Efeito de 30%
    2% 77.000 19.000 8.500
    5% 30.000 7.500 3.300
    10% 14.000 3.500 1.600

    Confirme numa calculadora de amostra antes de publicar o plano.

  4. Converta em duração: amostra total dividida pelos visitantes semanais da página que entram no teste. Arredonde para semanas inteiras, mínimo 2 (o comportamento muda entre dia de semana e fim de semana), máximo 6 (cookies expiram e o mesmo visitante vira dois). Se passar de 8 semanas, aumente o efeito mínimo, teste uma mudança maior ou não teste.

  5. Fixe a regra de parada antes de começar: data de fim, amostra alvo, e o que se faz se o resultado for inconclusivo (implementa a mais barata, ou testa outra coisa). Olhar o resultado no meio e parar quando "deu significativo" é a forma mais comum de declarar vencedor falso.

  6. Planeje o QA: variante renderiza em todos os navegadores e tamanhos de tela; não há piscada da versão original antes da variante; a métrica primária dispara nas duas versões; tráfego interno excluído; nenhum outro teste rodando na mesma página; nenhuma promoção ou feriado dentro da janela.

  7. Prepare o registro do resultado já no plano: efeito observado com intervalo de confiança, métricas de guarda, segmentos (dispositivo, origem), decisão e aprendizado. Teste sem registro se perde em 3 meses e alguém propõe o mesmo de novo.

Formato da entrega

  1. Ficha do teste: nome, hipótese, página, público, variantes (descrição e captura), métrica primária, métricas de guarda, linha de base, efeito mínimo, amostra por variante, duração em semanas, datas de início e fim, ferramenta, responsável.
  2. Cálculo: os números usados e o resultado, para alguém conferir.
  3. Regra de decisão: o que acontece se a variante vence, perde ou empata.
  4. Checklist de QA com espaço para marcar cada item e quem conferiu.
  5. Modelo de registro do resultado, preenchido ao final.

Critérios de qualidade

  • Uma métrica primária. As outras estão em listas separadas.
  • Amostra e duração aparecem com o cálculo, não só o resultado.
  • Duração em semanas inteiras, entre 2 e 6.
  • A hipótese cita o dado que a motivou.
  • Se o teste não é viável no volume atual, o plano diz isso e propõe a alternativa.

Armadilhas

  • Parar cedo porque "já deu 95%". Com espiadas diárias, a chance de um falso vencedor passa de metade.
  • Pescar métrica: a primária não moveu, mas "cliques no botão subiram". Cliques não eram a pergunta.
  • Testar em semana atípica (Black Friday, lançamento, queda do site) e generalizar.
  • Mudança pequena em página com pouco tráfego: o teste precisaria de meses para detectar o efeito.
  • Ignorar segmentos que se anulam: variante ganha no celular e perde no desktop, e a média diz "empate".
  • Tratar empate como derrota. Empate diz que a mudança não importou: implemente a mais barata e siga para uma hipótese maior.
  • Rodar dois testes na mesma página ao mesmo tempo sem desenho para isso.