A unidade citada não é a página, é o parágrafo
Existe uma intuição herdada do período clássico da busca que continua organizando o trabalho da maior parte das equipes de conteúdo: a de que a unidade de competição é a página. Escreve-se um artigo, ele concorre com outros artigos, e um deles aparece primeiro. Todo o vocabulário de metas — posição média, impressões por página, clique por página — reforça essa imagem, porque as ferramentas de medição foram construídas em torno dela.
Publicamos pesquisa editorial: não é consultoria e não garante resultado comercial. O que se descreve aqui é leitura de mecanismo apoiada em observação de mercado. Todas as proporções citadas vêm de análises de terceiros, com metodologias diferentes entre si, mudam ao longo do tempo e não são medições nossas.
O que os sistemas de resposta fizeram foi deslocar a escala da disputa. Quando alguém faz uma pergunta a um mecanismo que responde em linguagem natural, o resultado não é uma lista de páginas: é um texto montado a partir de fragmentos vindos de várias fontes. Isso significa que a unidade que pode ser selecionada e citada não é o documento, é o trecho. Um artigo de duas mil palavras pode ter dois parágrafos excelentes e dezoito parágrafos invisíveis, e o sistema não cita o artigo: cita os dois parágrafos, se os encontrar e se eles forem os melhores disponíveis naquele instante.
Essa mudança de escala tem uma consequência que costuma incomodar. Uma página pode ser excelente na avaliação humana — bem escrita, bem fundamentada, bem estruturada em nível macro — e não ter nenhum trecho extraível, porque cada argumento depende do anterior para fazer sentido. O oposto também acontece: uma página mediana, com um trecho particularmente bem resolvido, aparece citada com frequência desproporcional. Não é injustiça; é consequência direta de qual é a unidade.
Fan-out: uma pergunta se desdobra em muitas subperguntas
O segundo mecanismo é o menos intuitivo e o que mais altera o trabalho de redação. Um mecanismo de resposta raramente trata uma consulta como uma coisa só. O procedimento usual é decompor a pergunta em várias consultas derivadas — o chamado fan-out — e executar cada uma delas em paralelo, buscando fragmento para cada pedaço. Quando alguém pergunta como escolher um fornecedor de determinado serviço, o sistema não procura uma única resposta completa: procura ao mesmo tempo o que considerar, o que evita arrependimento, quanto custa, qual é o prazo típico, quais erros são comuns, e como essa escolha difere da escolha de outra categoria.
Cada uma dessas subperguntas é uma oportunidade de entrada, e todas elas podem ser atendidas por páginas diferentes. É por isso que responder apenas à pergunta principal não basta: quem cobre unicamente o que é determinado conceito fica de fora quando a pessoa faz a pergunta que realmente queria fazer, que é quanto custa, quanto tempo leva ou o que acontece quando dá errado.
Daí a noção de cobertura de subperguntas, que é mais útil do que qualquer lista de palavras-chave. Em vez de perguntar quais termos a página deve conter, a pergunta produtiva é quais perguntas a pessoa que chegou aqui ainda terá depois de ler esta página. A maior parte dessas perguntas é previsível: por quê, como, em quanto tempo, quanto custa, comparado com o quê, e onde isso falha. Uma página que responde a quatro dessas seis dimensões tem quatro portas de entrada; uma página que responde a uma tem uma.
Vale registrar o limite. Cobrir subperguntas não significa inflar o texto com variações de uma mesma ideia. Significa que cada dimensão da dúvida recebe uma resposta substantiva, com conteúdo próprio, ou não recebe resposta alguma.
Previsibilidade estrutural: por que blocos vencem a prosa corrida
O terceiro mecanismo é o mais documentado em análise de setor e o mais fácil de aplicar. Quando se compara o tipo de conteúdo que aparece citado com o tipo de conteúdo que não aparece, uma regularidade se repete em estudos feitos por grupos diferentes: conteúdo estruturado é citado com frequência maior do que prosa corrida. Definição em bloco, lista numerada, tabela de comparação e par de pergunta e resposta aparecem, em análises independentes, acima do texto contínuo, e a prosa corrida aparece no extremo inferior dessas comparações.
Apresentamos isso deliberadamente como direção, e não como porcentagem. As metodologias diferem: algumas medem páginas citadas por um único produto, outras medem vários; algumas contabilizam menção, outras contabilizam link; e todas mudam com o tempo porque os sistemas mudam. O que se pode afirmar com segurança é a ordem de grandeza relativa, e não um valor.
A explicação do mecanismo é mais interessante do que o número, e é o que torna a observação utilizável. Extrair um trecho é uma operação cara para quem responde: é preciso localizar o fragmento, verificar se ele se sustenta fora do contexto, decidir se responde à pergunta e, em muitos casos, atribuí-lo. Um bloco que já tem forma de resposta reduz o trabalho em todas essas etapas. Uma definição que começa com o nome do conceito e o verbo ser não exige inferência. Uma lista numerada já informa que há ordem e quantos itens existem. Uma tabela já declara que dois objetos estão sendo comparados em dimensões explícitas. A prosa obriga o sistema a reconstruir uma estrutura que o autor não ofereceu.
Há um benefício colateral que vale mais do que o principal: estrutura previsível para humanos e máquinas é a mesma coisa. Leitor que corre os olhos pela página procurando a resposta se beneficia exatamente do mesmo padrão que beneficia a extração. Não é um caso de escrever para máquina contra escrever para pessoa; é um caso em que os dois interesses coincidem numa faixa estreita de clareza.
A resposta nos primeiros 30 por cento do documento
O quarto mecanismo é posicional, e é o que mais contradiz a prática jornalística tradicional. Diversas análises de setor apontam que uma fração relevante do conteúdo citado está concentrada na parte inicial do documento — algo frequentemente situado na faixa de um quarto a dois quintos do texto, ou seja, nos primeiros 30 por cento do documento, tomada essa faixa como referência aproximada de mercado e não como medição nossa.
A interpretação correta não é mística. Sistemas de extração tendem a trabalhar com janelas de leitura limitadas e com custo crescente por posição, e os autores, por sua vez, concentram as afirmações mais gerais e mais citáveis justamente na abertura. Os dois efeitos se somam, e o resultado é que as primeiras frases de uma página fazem uma parte desproporcional do trabalho de citação.
A implicação para redação é direta e desconfortável para quem foi treinado a construir suspense antes da tese: cada seção precisa responder à sua pergunta na primeira frase, antes de qualquer contextualização. Abertura que apresenta o tema, menciona a importância histórica do tema e promete voltar ao assunto está gastando a janela de maior valor com material que ninguém vai citar e pouca gente vai ler.
Isso não significa abandonar contexto. Significa inverter a ordem: a resposta vem primeiro, em uma ou duas frases que se sustentam sozinhas, e a contextualização vem depois, para quem quiser continuar. O leitor impaciente leva a resposta, o leitor interessado leva o raciocínio, e o sistema de extração leva um trecho que já está pronto.
Contagem de palavras importa menos do que densidade de fato
Durante anos, a pergunta sobre tamanho de texto dominou discussões de conteúdo, e a resposta variou conforme a fonte e a época. As análises de maior escala feitas especificamente sobre citação por sistemas de resposta trouxeram um resultado que merece ser registrado: a correlação entre tamanho do documento e probabilidade de citação é fraca. Nesse conjunto de observações, contagem de palavras aparece como variável de baixo poder explicativo quando comparada com estrutura, frescura e clareza de resposta.
O que aparece no lugar do tamanho é outra coisa, que chamamos de densidade de fato. Densidade aqui não significa acumular dados; significa que um trecho curto contém informação verificável suficiente para ser citado sem que o sistema precise buscar complemento em outra fonte. Um parágrafo de três frases que traz uma afirmação, uma condição de aplicação e um número com fonte é mais extraível do que trezentas palavras de desenvolvimento retórico que terminam numa afirmação vaga.
Há uma consequência prática para revisão de arquivo. Ao reler uma página, o teste não é quanto ela cortaria, e sim se cada bloco sobrevive sozinho. Bloco que começa com pronome relativo, que retoma sujeito de parágrafo anterior ou que depende de definição apresentada seiscentos caracteres antes é bloco morto do ponto de vista de extração, por mais elegante que seja a costura.
A posição orgânica deixou de ser dominante
O quinto mecanismo é o que encerra de vez a equivalência entre ranquear e ser citado. Acompanhamentos de setor realizados ao longo de períodos de cerca de um ano registram uma queda acentuada na proporção de páginas citadas que vinham das primeiras posições do resultado orgânico. Em outras palavras, a posição orgânica deixou de ser dominante como preditor de citação: estar entre os primeiros resultados continua ajudando, mas deixou de ser condição.
Apresentamos isso como descrição de tendência, sem valor fixo, porque as medições divergem quanto à amplitude e ao ponto de partida. A direção, porém, é consistente o bastante para alterar decisão de gestão: usar posição média como único indicador de sucesso em ambiente de resposta gerada é medir uma coisa por outra.
A implicação positiva é real e vale ser dita. Se a citação depende da qualidade do trecho e não da posição da página, então uma publicação sem histórico de autoridade consegue ser citada para a pergunta específica que responde bem. Isso é uma abertura que não existia no regime anterior, em que a primeira página de resultados era praticamente a única porta.
A implicação negativa também é real. Não se pode mais inferir desempenho em resposta gerada a partir de relatório de posições, e a ausência de queda no ranking passou a ser compatível com perda total de visibilidade na superfície que mais cresce. Quem mede apenas Search Console está olhando para o retrovisor.
Quatro padrões de trecho extraível
Reduzir isso a regra de template empobrece o resultado, mas descrever os padrões que mais frequentemente aparecem como citados é útil, desde que se entenda a intenção que cada um atende. O que determina a escolha do padrão é a pergunta, não a preferência estética de quem escreve.
### Bloco de definição
Serve à intenção do tipo o que é X. A forma eficiente é curta e reconhecível: o termo, o verbo de ligação, a classe a que pertence, e a diferença que o separa do vizinho mais próximo. A definição que apenas repete o termo com outras palavras — crescimento sustentável é o crescimento que se sustenta — não informa nada e não é citável.
### Lista numerada
Serve à intenção de ordenação: os N principais, as etapas, os critérios em ordem de importância. A lista numerada carrega uma informação que a lista com marcadores não carrega, que é a ordem, e ordem é conteúdo. Serve também a consultas de amplitude, em que o sistema busca um conjunto finito de itens para compor a resposta.
### Tabela de comparação
Serve à intenção de escolha entre alternativas. Uma tabela obriga a declarar quais dimensões estão sendo comparadas, o que é justamente a informação que falta quando a comparação é descrita em prosa. É o padrão mais trabalhoso de produzir e o que mais frequentemente decide uma consulta de seleção, porque responde à pergunta que a pessoa realmente faz quando compara.
### Par pergunta-resposta
Serve à cauda longa de perguntas específicas. Ele é eficiente quando a página tem, de fato, uma sequência de dúvidas distintas sobre o mesmo assunto, cada uma com resposta própria. É ineficiente quando é fabricado: não há ganho em transformar uma argumentação contínua em dez pares de pergunta e resposta, e há perda, porque a estrutura inventada fragmenta raciocínio que precisava correr junto.
### Processo passo a passo: por que rende menos do que se espera
O processo passo a passo é o caso que melhor ilustra a distância entre intuição e observação. Ele tem posição central na tradição da busca clássica e, nas amostras de conteúdo citado por sistemas de resposta, aparece com frequência menor do que definição, lista, comparação e par de pergunta e resposta. Uma explicação plausível é que instrução procedural depende de detalhe de execução, ferramenta e contexto, e por isso é mais difícil de extrair sem deformar. Outra é que o próprio sistema costuma conseguir compor uma sequência genérica sem precisar citar ninguém.
Isso não é argumento contra escrever processo; é argumento para não transformar toda a página em processo quando a intenção da busca era outra.
A unidade de resposta e suas quatro partes
Os padrões acima são formas de organizar a página. Dentro de cada um deles existe uma unidade menor, que é o que de fato é selecionado: a unidade de resposta. Ela tem quatro partes, e a ordem importa porque imita a ordem em que uma pessoa processa informação.
A primeira é a afirmação, ou claim: uma frase direta, sem qualificador, que responde à pergunta. A segunda é o contexto: uma frase dizendo por que isso importa ou em que condição vale. A terceira é a evidência: dado, caso ou referência com origem. A quarta é a conclusão: uma frase dizendo o que o leitor faz com aquilo.
Na prática, isso cabe em três ou quatro frases, e é a menor estrutura que consegue ficar de pé fora da página. A falha mais comum é a ausência da primeira parte: blocos que começam discutindo o contexto, chegam à evidência e terminam numa conclusão prudente, sem nunca ter dito o que afirmam. Para o leitor, isso custa atenção; para o sistema, custa a extração, porque não há uma frase que possa ser retirada sem carregar junto metade do parágrafo.
A segunda falha comum é a afirmação em forma de pergunta. Títulos e aberturas interrogativas são elegantes e não transportam informação. Se a primeira frase do bloco não é uma frase declarativa, o bloco não tem o que ser citado.
Atribuição nominal e evidência verificável
A parte da evidência merece atenção específica, porque é onde a maior parte das páginas perde a citação por descuido evitável. Há dois modos de apresentar evidência. No primeiro, cita-se a fonte pelo nome: estudo de determinada instituição, relatório de determinado órgão, dado de determinada pesquisa, com o ano. No segundo, usa-se atribuição vaga: pesquisas mostram, estudos indicam, especialistas afirmam.
O segundo modo não serve para nada em ambiente de resposta gerada, por uma razão estrutural. Um sistema que vai entregar uma informação a uma pessoa precisa poder verificar a origem e poder transmiti-la adiante com a origem. Atribuição vaga não é verificável e não é transmitível: o sistema não consegue confirmar a afirmação nem dizer a quem a lê de onde ela vem. Por isso a atribuição nominal — mencionar a fonte pelo nome, com data quando houver — não é zelo acadêmico; é condição de uso.
A mesma lógica vale para evidência verificável de produção própria. Dado interno é legítimo e muitas vezes é o único disponível, mas precisa ser identificado como interno, com método e período descritos em uma frase. Curva sem método é ilustração; número com período e amostra é evidência.
Existe um limite ético que se sobrepõe à técnica e que já tratamos em outra edição sobre evidência: quando o número não pode ser rastreado, a alternativa correta é não publicar número. Afirmação qualitativa honesta é melhor do que estatística inventada, e o custo de uma estatística não rastreável descoberta depois é a confiança na página inteira.
Número específico em vez de adjetivo
Um desdobramento do mesmo princípio aparece de forma consistente nas análises de conteúdo citado: material que traz valores específicos tende a ser mais citado do que material que descreve magnitude por adjetivo. A explicação é simples. Um número específico em vez de adjetivo pode ser transportado para dentro da resposta; um adjetivo não transporta nada além de uma impressão.
Escrever que o prazo médio é de duas a seis semanas, com indicação de que depende de determinada variável, é uma informação que o sistema pode reproduzir e que a pessoa pode usar. Escrever que o processo costuma ser rápido é uma opinião sobre o processo, que ninguém consegue verificar nem aplicar.
Isso vale também para intervalo. Quando não há ponto único confiável, o intervalo com a condição de variação é honesto e transportável: faixa de mercado, dependente de porte, sujeita a mudança. O que se deve evitar é a precisão falsa — três casas decimais para uma estimativa grosseira criam uma impressão de exatidão que a evidência não sustenta, e esse é um dos modos mais comuns de perder credibilidade sem perceber.
Há um caso em que o adjetivo é a escolha certa: quando o fenômeno é genuinamente qualitativo e a tentativa de quantificá-lo produziria número fictício. A regra não é número sempre; é número quando existe número.
Ordem de execução por custo crescente
Organizada por custo de execução, e não por importância, a sequência de intervenções em uma página existente costuma ser a seguinte.
O passo mais barato é reescrever subtítulos como perguntas. Em vez de rótulos descritivos, usa-se a frase que a pessoa digitaria, porque é essa frase que precisa casar com a subpergunta que o sistema vai resolver. É trabalho de minutos por página.
O segundo é garantir que, logo depois de cada subtítulo, exista um parágrafo que se sustente sozinho e responda à pergunta antes de qualquer desenvolvimento. Na maioria dos arquivos, isso é uma reorganização de parágrafos existentes, não produção nova.
O terceiro é revisar todo número com data vencida e toda fonte sem nome, substituindo o que estiver defasado e removendo o que não puder ser verificado. O quarto é converter uma comparação descrita em prosa numa tabela, o que exige decisão editorial: quais dimensões de fato importam na escolha.
O quinto é tornar visível a data de última alteração, e o sexto é verificar se cada novo bloco adicionado mantém a resposta no início do bloco. A regra que resume todos os passos é essa: toda adição deve preservar resposta em primeiro lugar, porque é esse pedaço que faz a maior parte do trabalho.
Auditoria por conjunto fixo de prompts
Nenhuma dessas mudanças pode ser avaliada por impressão. O instrumento que descrevemos em edição anterior é a auditoria por conjunto fixo de prompts, e ele continua sendo o mais adequado ao nível do trecho, com uma adaptação: em vez de perguntar apenas se a marca aparece, registra-se qual trecho foi citado.
O procedimento é montar uma lista curta de perguntas representativas das intenções que a publicação quer atender, com variações que cubram definição, comparação, custo, prazo e limite, e repeti-las em intervalos regulares, anotando a resposta inteira. O que se procura não é presença de marca; é presença do trecho específico que se reescreveu. Se o trecho não aparece, a reescrita falhou em algum dos pontos anteriores: falta afirmação direta, falta evidência nominal, ou a subpergunta não estava coberta.
Duas advertências de método. A primeira é que resposta gerada varia entre execuções, de modo que uma única consulta não é evidência de nada; é preciso repetir e olhar tendência. A segunda é que o conjunto de prompts precisa permanecer fixo entre as rodadas, porque mudar a pergunta anula a comparação.
Atualização antes de reclamar de queda
Quando uma página perde presença em resposta gerada, a reação usual é atribuir a queda a mudança de algoritmo, e essa atribuição é conveniente porque não exige trabalho. Na maior parte dos casos que observamos, a explicação é mais prosaica: alguém publicou versão mais recente do mesmo conteúdo, com número atualizado e trecho mais fácil de extrair.
Daí a disciplina de atualização antes de reclamar de queda. Antes de qualquer hipótese sobre mudança de sistema, verifica-se três coisas: se o trecho concorrente que hoje aparece tem data mais recente, se ele responde à pergunta em menos palavras, e se ele traz número que o nosso material não traz. Se qualquer uma das três for verdadeira, não houve mistério: houve substituição por material melhor.
Isso se conecta ao que já publicamos sobre as quatro saídas de uma página no arquivo, e ao ponto que tratamos lá com mais detalhe: trocar a data sem trocar o conteúdo não é atualização, é redatagem. No ambiente de extração, a consequência é pior do que no ambiente clássico, porque material citado é comparado com material citado em janela curta, e conteúdo idêntico com data nova perde a disputa assim que o concorrente publicar número novo de verdade.
O que não fazer
Quatro práticas se espalharam com a popularização do tema e produzem mais dano do que ganho.
A primeira é encher uma página escrita para uma única intenção com variantes de formulário da mesma pergunta, na esperança de cobrir todas as consultas. Isso produz sobreposição interna, dilui a correspondência da página com a intenção original e cria o problema de canibalização que se resolve com consolidação, não com repetição.
A segunda é converter em pares de pergunta e resposta um raciocínio que precisa correr de forma contínua. Argumento que depende de acumulação, quando fragmentado em dez blocos de pergunta e resposta, perde a força e vira lista de trivialidades.
A terceira é acrescentar marcação estruturada de perguntas e respostas, como o tipo FAQPage, a uma página que não contém perguntas e respostas reais. A marcação declara algo que o documento não entrega, e discordância entre declaração e conteúdo é o tipo de sinal que uma equipe não deveria emitir voluntariamente. Já tratamos em outra edição do que faz sentido marcar e do que não faz; aqui basta o princípio: a marcação descreve o que existe.
A quarta, a mais comum e a mais cara, é mexer apenas na data. Já mencionada acima, vale repetir porque é o hábito mais difícil de abandonar: redatar sem conteúdo novo é emitir um sinal falso, e o custo aparece depois, na comparação com material que realmente mudou.
Como isso se diferencia do que já publicamos
Esta edição tem um recorte deliberadamente estreito, e distingui-lo do resto do arquivo evita retrabalho. Já escrevemos sobre auditoria mensal e sobre a medição de participação em respostas, que é o nível do programa e da série temporal. Já escrevemos sobre o que marcar em dados estruturados, que é o nível da declaração técnica. Já escrevemos sobre mapa de entidades e consistência de nomenclatura, que é o nível da arquitetura do site. E já escrevemos sobre as quatro decisões possíveis para uma página do arquivo, que é o nível do ativo.
O que fica aqui é uma escala menor do que todas essas: a forma de um único trecho. É o nível em que se decide se uma frase é uma afirmação citável ou uma observação educada, se um bloco se sustenta fora da página, se a evidência tem nome. Nenhuma das edições anteriores desce a esse nível, e é nele que a citação acontece.
Onde está o limite do que isso faz
Encerramos com o que este trabalho não entrega, porque é a parte que costuma ser cortada. Estrutura melhora a probabilidade de um trecho ser localizado, considerado extraível e considerado melhor do que as alternativas disponíveis naquele momento. Não garante citação: um trecho bem formado pode perder para outro trecho melhor formado, ou para uma fonte com histórico que o sistema prefira naquele caso.
Também não garante posição em resultado orgânico. As duas superfícies têm lógicas parciais sobrepostas e variáveis próprias, e conteúdo altamente citado pode continuar mal posicionado, assim como o contrário. E não garante inclusão em produto específico: cada sistema de resposta tem critérios próprios de seleção de fontes, cobertura própria de idioma e mercado, e políticas próprias sobre o que cita.
O que se pode afirmar com honestidade é limitado e suficiente. A unidade de disputa passou da página para o trecho, a cobertura de subperguntas passou a valer mais do que a correspondência com uma única consulta, e a clareza estrutural passou a ser uma propriedade da redação, não uma técnica de ajuste fino. Quem reorganiza o arquivo em torno disso aumenta a chance de ser encontrado quando a resposta for montada. Quem não reorganiza continua escrevendo para um ranking que já não é o único lugar onde a decisão acontece.
Continuar lendo
Encontre a próxima pergunta que vale testar.
Percorra o arquivo com pesquisa sobre estratégia de conteúdo, busca social, GEO e geração de leads B2B.
Ver o arquivo