A pergunta que a atribuição responde, e a que ela não responde
Todo relatório de mídia responde a uma pergunta aparentemente óbvia: quem estava presente quando a conversão aconteceu. A atribuição de último clique é a forma mais crua dessa pergunta — ela toma o crédito do resultado e o entrega inteiro ao último contato registrado antes da conversão. O problema não está na aritmética; está na pergunta. Saber quem estava na sala não é a mesma coisa que saber o que teria acontecido se a sala estivesse vazia.
Publicamos pesquisa editorial: não é consultoria e não garante resultado comercial. O que se segue descreve mecanismos a partir de literatura pública de mensuração e de observação do funcionamento das plataformas, não um estudo conduzido por nós. Nenhuma empresa e nenhuma ferramenta é indicada aqui como recomendação, e nenhum número deve ser lido como benchmark. Trata-se de direção, não de medição.
A pergunta que interessa a quem administra orçamento é contrafactual: esta conversão teria acontecido de qualquer forma? A distância entre as duas perguntas costuma ser exatamente o lugar onde o orçamento de mídia é consumido sem que ninguém perceba.
Atribuição é contabilidade, não causalidade
Atribuição é uma convenção contábil. Ela não cria informação sobre o mundo; ela distribui o crédito de um resultado que já aconteceu segundo uma regra escolhida de antemão. A regra de último clique dá cem por cento ao último toque. Outras regras repartem o crédito entre toques, dão peso decrescente no tempo, ou usam modelos baseados em dados. Todas elas operam sobre eventos observados. Nenhuma delas contém um contrafactual.
Isso tem uma consequência prática desconfortável: uma conversão perfeitamente atribuída pode ser uma conversão que teria acontecido de qualquer jeito. O caso mais comum é o da pessoa que já decidiu, pesquisa o nome da empresa e clica no anúncio para chegar até lá. O anúncio foi o caminho mais curto, não a causa. Em termos de relatório, ele ganhou cem por cento do crédito. Em termos de caixa, ele custou o preço de um clique para uma venda que já existia.
O mesmo vale, em escala muito maior, para o público que já está no funil. Remarketing para quem abandonou uma etapa, campanhas para quem já comprou, campanhas de marca disputando a busca pelo próprio nome: em todos esses casos, a pergunta relevante não é quanto o relatório atribui, e sim quanto daquilo não aconteceria sem o anúncio.
Incrementalidade definida por uma subtração
A definição operacional de incrementalidade é uma subtração: resultado do grupo exposto menos resultado do grupo que não foi exposto. A conversão incremental é essa diferença. Se o grupo que viu anúncios gerou mil resultados e o grupo impedido de ver gerou oitocentos, a conversão incremental é duzentos — e não mil.
A atribuição incremental, por sua vez, é a fração do que o relatório atribui que sobrevive a essa conta. Ela pode ser alta ou baixa dependendo do tipo de campanha, do estágio do funil e do quanto a marca já é conhecida. O que importa aqui não é o valor típico, e sim o método: sem um grupo de comparação sorteado, não há como estimar essa fração, apenas supô-la.
A unidade que torna a subtração legítima é a randomização. É preciso que os dois grupos sejam, em média, iguais em tudo — propensão a comprar, sazonalidade, exposição a outras mídias, comportamento histórico — e diferentes apenas em uma coisa: ter ou não ter visto o anúncio. Qualquer desenho que não garanta isso está medindo outra coisa e chamando de incrementalidade.
Na prática, o grupo que é deliberadamente impedido de receber a campanha recebe vários nomes na literatura de mercado. Nós vamos chamá-lo de grupo de controle quando a ênfase estiver na comparação, e de grupo de retenção quando a ênfase estiver no ato de reter a entrega — o holdout. São a mesma ideia vista de dois ângulos.
Três desenhos de teste, e o que cada um realmente responde
### Teste de conversão incremental: a pessoa como unidade de randomização
O teste de conversão incremental, conhecido na plataforma como Conversion Lift, sorteia pessoas em vez de lugares. O sistema separa uma parcela do público elegível, retém a entrega para essa parcela e compara o que aconteceu nos dois lados dentro de uma janela definida. Como a atribuição de cada pessoa ao grupo é aleatória, as diferenças sistemáticas entre elas se cancelam em média, e a diferença observada pode ser lida como efeito.
É o desenho mais limpo conceitualmente e o mais exigente operacionalmente. Ele precisa de volume: se a conversão é rara, a diferença entre os grupos demora a se distinguir do ruído. Para contas B2B de ticket alto e poucas dezenas de conversões por mês, esse desenho frequentemente não é viável sem uma janela muito longa — e janelas longas têm seu próprio custo, como veremos.
### Teste geográfico: o território como unidade de randomização
No teste geográfico, a randomização acontece sobre regiões. Algumas regiões recebem a campanha, outras ficam sem ela, ou recebem níveis diferentes de investimento. A leitura é feita comparando o resultado agregado de cada região — vendas totais, receita total, volume de pedidos — contra a linha de base daquela região.
A vantagem desse desenho é a durabilidade. Como ele não depende de parear usuários individuais, ele continua funcionando em um ambiente de restrição de rastreamento, e pode ser alimentado por dados agregados do próprio negócio, como o faturamento por região vindo do ERP. Isso o torna uma das poucas formas de medir mídia quando a identificação individual é limitada.
O preço é outro tipo de exigência: é preciso encontrar regiões comparáveis, com histórico parecido, sazonalidade parecida e volume suficiente. Um punhado de grandes regiões produz poucos graus de liberdade e, portanto, pouca capacidade de detectar efeitos pequenos. Regiões pequenas e numerosas são estatisticamente melhores, mas aumentam o risco de vazamento de mídia entre elas.
### Retenção por campanha ou por público
O terceiro desenho é o mais simples de montar: reter uma fatia de um público específico — por exemplo, uma parte da audiência de remarketing — e comparar com a fatia que recebe. Ele não responde se a mídia funciona no agregado; ele responde uma pergunta mais estreita, e muitas vezes mais valiosa: este esforço específico está assumindo o crédito de uma demanda que já existia?
É o teste indicado para a suspeita de autosserviço de crédito. Quando a suspeita é forte e a resposta é sim, o ganho não vem de otimizar a campanha, e sim de reduzir ou redirecionar o que se gasta com ela.
Por que o teste A/B dentro da conta não é um teste de incrementalidade
Existe uma confusão persistente entre comparar versões e medir causalidade. Um teste A/B de criativos responde qual versão performa melhor entre as pessoas que o sistema escolheu entregar. As duas versões são servidas, e o sistema de entrega continua fazendo o que faz: encontrar quem tem mais probabilidade de converter.
Isso é útil para escolher um anúncio. Não diz nada sobre se o anúncio, qualquer versão dele, gerou algo que não existiria. Um teste A/B pode dar uma versão vencedora em uma campanha cuja contribuição incremental seja próxima de zero. As duas afirmações não se contradizem, porque medem coisas diferentes.
A confusão é compreensível porque o vocabulário se sobrepõe. Teste, grupo, divisão, resultado. A diferença está em uma palavra: randomização com retenção. Se ninguém foi privado da mensagem, não há contrafactual, e sem contrafactual não há efeito causal mensurável.
Divergência de entrega: o detalhe que destrói a intuição
Mesmo quando há dois grupos, é preciso perguntar como a entrega foi distribuída entre eles. Sistemas de leilão não distribuem tráfego como um laboratório distribui cobaias. Eles alocam impressões segundo previsão de desempenho, preço, horário, posicionamento e concorrência. O resultado é que dois conjuntos de anúncios dentro da mesma conta podem acabar falando com populações diferentes, em momentos diferentes, em superfícies diferentes.
A esse fenômeno damos o nome de divergência de entrega. Ele é invisível na maioria dos relatórios, porque os relatórios mostram resultado por conjunto, não composição de público por conjunto. E ele corrói comparações que pareciam óbvias: se o conjunto A falou com pessoas mais quentes que o conjunto B, a diferença de resultado mede a diferença de público misturada com a diferença do que está sendo testado.
É por isso que desenho importa mais que análise. Nenhuma técnica estatística aplicada depois do fato reconstrói uma randomização que não aconteceu. Onde a randomização é por pessoa, a divergência de entrega é contida por construção. Onde a unidade é a região, ela desaparece da análise porque a leitura é feita no total agregado. Onde ela é deixada ao sistema, ela precisa ser tratada como uma ameaça explícita à validade.
O custo estatístico de enxergar efeitos pequenos
Todo teste tem um poder estatístico: a probabilidade de detectar um efeito real de determinada magnitude, caso ele exista. E todo teste tem um efeito mínimo detectável: o menor aumento que aquele desenho, com aquele volume, consegue distinguir do ruído com segurança razoável. Os dois conceitos são dois lados da mesma restrição, e é essa restrição que define o que dá para perguntar.
A relação entre eles é desfavorável de um jeito específico. O tamanho de amostra necessário cresce aproximadamente com o inverso do quadrado do efeito que se quer detectar. Em termos práticos: reduzir pela metade o aumento relativo que se pretende enxergar exige, em ordem de grandeza, cerca de quatro vezes mais amostra. Querer detectar um terço do efeito original custa aproximadamente nove vezes. Esta é uma direção estatística geral, não uma medição nossa; serve para calibrar expectativa antes de desenhar qualquer coisa.
A consequência para contas pequenas é direta e frequentemente mal interpretada. Com orçamento modesto, é comum obter um resultado cujo intervalo de confiança cruza o zero. Isso não significa que a campanha não funciona. Significa que o teste não conseguiu dizer. Registrar isso como prova de ineficácia é cometer um segundo erro sobre o primeiro.
O intervalo de confiança merece ser lido como um intervalo, não como um ponto. Ele descreve a faixa de valores compatíveis com os dados. Dizer que o efeito está entre um valor negativo pequeno e um valor positivo grande é uma informação real: é o tamanho da incerteza que sobrou.
Linha de base, e o que o grupo de controle continua vendo
A linha de base é o que se espera que acontecesse sem a campanha. Toda estimativa de efeito é uma diferença contra essa referência, o que significa que qualquer erro na referência contamina a resposta.
Uma precaução barata é medir os dois grupos antes de começar. Se antes do teste as regiões ou os públicos já diferem de forma consistente, essa diferença prévia é um aviso de que a randomização ou a seleção de unidades não produziu grupos comparáveis. Outra precaução é registrar o período anterior do próprio negócio, para saber se a linha de base já estava subindo ou caindo por razões alheias à mídia.
A contaminação é o outro lado do mesmo problema. Ela ocorre quando o grupo de controle vê a mensagem mesmo assim — por outra campanha na mesma conta, por outro anunciante da mesma marca, por outro dispositivo, por mídia orgânica — ou quando o efeito vaza de uma unidade para outra: pessoas que moram em uma região e compram em outra, mídia nacional que atravessa fronteiras regionais, comparadores e marketplaces que mostram a oferta independentemente de onde o anúncio foi veiculado.
O mais honesto é assumir que a contaminação existe em grau maior que zero e documentar o que o grupo de controle ainda recebe: outras campanhas, e-mail, afiliados, equipe comercial atuando no mesmo período. Feito isso, a leitura muda de nome. O que se mede não é o efeito da mídia contra o vazio, e sim o efeito da mídia contra todo o resto que a empresa já faz. Essa é uma quantidade menor, mas é legítima — desde que seja chamada pelo nome certo.
Sazonalidade, promoção e a escolha da janela
A sazonalidade é a ameaça mais previsível e, ainda assim, uma das que mais derrubam testes. Se um evento comercial relevante cai dentro da janela de leitura, o resultado reflete o evento tanto quanto a mídia. Em teste com unidade de pessoa, os dois lados atravessam o mesmo calendário, e o problema é menor. Em teste geográfico, se as regiões têm calendários econômicos diferentes — turismo, feriados locais, ciclos de safra — o mesmo evento age de forma desigual.
Em contexto B2B a sazonalidade tem formato próprio: fechamento de trimestre, liberação de orçamento anual, recesso de fim de ano, retomada lenta nos primeiros meses, feriados móveis que deslocam semanas inteiras. Uma campanha lida em janeiro e outra lida em março não estão comparando mídia; estão comparando momentos do calendário de compras.
Há três saídas possíveis, e nenhuma é perfeita. Escolher uma janela que atravesse o evento inteiro, para que ele apareça dos dois lados. Escolher uma janela que o evite completamente. Ou corrigir pela linha de base do período equivalente do ano anterior, assumindo que a estrutura se repete — o que é uma suposição, e como tal precisa ser declarada.
Janela de leitura e a disciplina de não espiar
Antes de o teste começar, deve existir uma data de leitura. A janela de leitura é o período combinado ao fim do qual os dados serão abertos e a decisão será tomada. Escrever essa data com antecedência é a parte mais barata e a mais frequentemente ignorada do desenho.
A razão é conhecida e contraintuitiva. Em um teste de horizonte fixo, olhar os dados repetidamente e parar quando o resultado parece bom aumenta substancialmente a chance de um falso positivo. Cada olhada é uma nova oportunidade de o ruído atravessar a linha por acaso. Se você olha dez vezes com o mesmo critério de uma olhada, a taxa de erro real é muito maior que a nominal.
Daí a regra de não espiar: não olhar antes do fim planejado, e não decidir antes do fim planejado. Isso não é uma exigência moral; é aritmética. Existem métodos que permitem monitoramento contínuo com fronteiras de decisão ajustadas para isso, e paradas antecipadas são perfeitamente legítimas se forem pré-registradas como regra de interrupção, com o critério escrito antes de qualquer dado existir. O que não é legítimo é inventar a regra depois de ver o número.
Falso positivo e o custo assimétrico de errar
Erros têm preços diferentes. Um falso positivo leva a escalar algo que não funciona, e o prejuízo se acumula silenciosamente enquanto o relatório de atribuição continua bonito. Um falso negativo leva a desligar algo que funciona, e o prejuízo aparece como queda de volume semanas depois, quando a conexão causal já não é óbvia.
Há um terceiro erro, menos discutido: testar muitos recortes ao mesmo tempo e reportar o vencedor. Se dez públicos são testados e apenas o melhor é relatado, o valor observado está enviesado para cima por construção, porque o melhor de dez sorteios não é o mesmo que o resultado de um sorteio. A saída é pré-registrar uma métrica primária e uma pergunta primária, e tratar todo o resto como observação exploratória que não decide orçamento.
Disciplina operacional: uma pergunta por vez
Um teste responde uma pergunta. Quando se tenta responder três ao mesmo tempo — criativo, público e orçamento — não se obtém três respostas; obtém-se nenhuma, porque o efeito de cada fator não pode ser separado dos outros dentro de um único contraste.
Durante a janela de leitura, a estrutura da conta precisa ficar parada: conjuntos, orçamentos, lances, criativos, públicos, e até o time que opera. Mudanças no meio do caminho não apenas mudam o que está sendo testado; elas tornam o resultado anterior e o posterior incomparáveis. Quando uma mudança for inevitável — e às vezes é — ela deve ser registrada com data, e o período afetado deve ser tratado com desconfiança explícita na leitura.
Antes do início, três coisas escritas: qual é a métrica de sucesso, qual é a magnitude de efeito que seria grande o bastante para mudar uma decisão, e qual é a data de leitura. Se a segunda não puder ser respondida, o teste provavelmente não vale a pena: não adianta medir com precisão uma diferença que não mudaria nada.
Cobrir o ciclo de compra, sobretudo em B2B
Em B2B, o intervalo entre o primeiro contato e a decisão raramente cabe em uma semana. Isso impõe um piso prático na janela de leitura: ela precisa cobrir ao menos um ciclo inteiro de compra, ou a medição vai capturar apenas a fatia de demanda que já estava madura e perder justamente a que a mídia influenciou.
Na prática de mercado, é comum ver horizontes da ordem de várias semanas como ponto de partida — frequentemente a partir de cerca de quatro semanas, e com alguma folga acima disso em compras consideradas ou com múltiplos decisores. Trate isso como faixa de referência, não como regra: o número certo depende do ciclo real do seu negócio, e ele varia por setor, por ticket e por quem assina.
Há também um atraso de medição que costuma ser esquecido. Se o evento de conversão acontece no CRM dias ou semanas depois do clique, a janela precisa incluir esse atraso, ou os últimos dias da campanha ficarão sem correspondência e o resultado ficará artificialmente baixo.
Para contas B2B de baixo volume, a consequência é dura mas clara: o teste por pessoa geralmente é inviável, e as alternativas são um teste geográfico longo, uma retenção por público com leitura em um evento de estágio intermediário, ou aceitar conviver com incerteza declarada.
Como usar o resultado: corrigir o alvo diário
O produto mais útil de um teste de incrementalidade não é o relatório; é um fator de correção. Comparando o que a plataforma atribuiu com o que foi medido como incremental, obtém-se uma razão — chamada na literatura de fator de lift — que pode ser aplicada à leitura cotidiana.
Isso muda a conta de equilíbrio. Se o relatório mostra um retorno sobre investimento aparentemente saudável, mas apenas uma fração daquilo é incremental, o retorno verdadeiro é menor, e o ponto de equilíbrio que orienta os lances e as metas de custo precisa ser mais rigoroso do que o relatório sugere. O contrário também vale: uma campanha com atribuição modesta e incrementalidade alta, em geral associada a alcance e a públicos mais frios, merece mais espaço do que o relatório de último clique concede.
O segundo uso é a realocação. O que se aprende sobre qual etapa realmente traz volume novo deve voltar para o plano de orçamento, não ficar arquivado no resultado do teste. Isso costuma significar tirar dinheiro de esforços que convertem bem no papel e colocar em esforços que parecem piores e produzem mais.
O fator de correção não é uma constante. Ele deriva com o tempo, com o amadurecimento da marca, com a composição do público e com mudanças na própria plataforma. A prática sensata é refazer a medição periodicamente e tratar o valor antigo como uma estimativa que envelhece.
Limites honestos: a plataforma mede a si mesma
Um teste de conversão incremental conduzido dentro da plataforma é executado por quem tem interesse no resultado. Isso não o torna inútil — pelo contrário, é frequentemente a medição causal mais acessível que existe — mas exige que ele seja tratado como uma leitura importante, e não como a única leitura.
Medições independentes, feitas por terceiros ou com dados próprios da empresa, por vezes chegam a números diferentes. Divergências acontecem por diferenças de janela, de definição de conversão, de unidade de randomização, de contaminação e até de qual pergunta foi feita. Quando dois métodos discordam, a discordância em si é informação: ela delimita a faixa em que a verdade provavelmente está.
O outro limite é o custo. Testar consome orçamento em retenção, consome tempo de operação e consome semanas de calendário. Não é viável testar tudo. A priorização razoável é gastar o esforço de medição onde três condições coincidem: o gasto é relevante, a incerteza é alta, e a decisão é reversível.
O que este texto não é
Este texto é sobre provar se a mídia causou alguma coisa. Ele não é sobre qualidade de lead, nem sobre alimentar a plataforma com dados de CRM para melhorar a otimização — esse é outro assunto, com outra pergunta e outro desenho. Também não é sobre configuração de eventos ou de infraestrutura de medição; pressupõe apenas que existe alguma forma de contar conversões nos dois lados do teste.
Por fim, repetimos o enquadramento: isto é pesquisa editorial, não é consultoria, e não garante resultado comercial. Os mecanismos descritos aqui são estáveis o bastante para orientar o raciocínio, mas as implementações mudam com a plataforma, e qualquer configuração citada deve ser conferida no painel da época em que você estiver lendo.
Encerramento: a pergunta que fica
A pergunta útil não é quanto a campanha trouxe, e sim quanto dela teria vindo de qualquer forma. Responder isso custa caro, exige disciplina e quase sempre devolve uma resposta menos lisonjeira que a do relatório de atribuição. Ainda assim, é a única pergunta cuja resposta permite decidir com segurança para onde vai a próxima unidade de orçamento.
O que se ganha não é um número melhor. É saber qual número está errado, e por quanto.
Continuar lendo
Encontre a próxima pergunta que vale testar.
Percorra o arquivo com pesquisa sobre estratégia de conteúdo, busca social, GEO e geração de leads B2B.
Ver o arquivo