Recuperação no idioma da pergunta
Mecanismos de resposta que fazem recuperação em tempo real operam sob restrição de tempo. Entre recuperar um documento já escrito no idioma da pergunta e recuperar um documento em outro idioma e traduzi-lo na hora, a primeira opção custa menos e produz texto mais seguro. Essa diferença de custo é o mecanismo que sustenta tudo o que vem a seguir.
A consequência prática é que a unidade de competição não é o domínio, é a versão idiomática. Em uma consulta em português, o concorrente de um conteúdo em português não é um conteúdo melhor em inglês; é outro conteúdo em português. Se não houver conteúdo em português suficiente sobre o assunto, o mecanismo pode traduzir, mas a tradução chega depois, com mais incerteza e mais risco de atribuição.
Isso inverte uma intuição comum de quem trabalha com conteúdo. A intuição diz que o melhor material vence independentemente de idioma. O que se observa é que o material no idioma certo vence primeiro, e o material melhor em outro idioma só entra quando o primeiro não resolve. Qualidade é desempate, não é critério de entrada.
É preciso declarar o alcance. O que segue não é consultoria, e não é um procedimento que produza resultado garantido. É um conjunto de observações sobre como conteúdo escrito em português se comporta em mecanismos que recuperam e citam, com todas as ressalvas de um objeto que muda rápido.
Conteúdo nativo x conteúdo traduzido
A pergunta que costuma aparecer é se vale mais traduzir integralmente um acervo ou escrever nativamente no idioma de destino. A resposta que os dados de recuperação sugerem é: escrita nativa vale mais que tradução integral, e a diferença não está no que se imagina.
A diferença não é de correção gramatical. Tradução automática produz texto gramaticalmente correto com facilidade. A diferença está na formulação. Quem escreve nativamente formula a pergunta como a pergunta é feita naquele idioma: usa os termos que as pessoas usam, as abreviações que circulam, a ordem em que os detalhes são mencionados. A tradução carrega a formulação de origem, e formulação é justamente o que a recuperação compara.
Há um segundo componente, de densidade. Texto traduzido tende a ser mais longo para dizer a mesma coisa, porque carrega estrutura sintática de origem. Texto nativo tende a ser mais direto e a concentrar a informação em menos tokens, o que facilita a extração de trecho. Quando o mecanismo precisa de um fragmento, o fragmento denso é mais fácil de isolar.
Isso não significa que traduzir seja inútil. Tradução é razoável para material de referência estável, que não muda e que responde a perguntas formulares. Tradução é ruim para material que precisa casar com a forma como as pessoas perguntam, porque essa forma é local e a tradução não a alcança. A linha divisória é: traduzir o estável, escrever o que depende de formulação.
Glossário de entidades e a mesma entidade em dois idiomas
Uma entidade raramente é nomeada da mesma forma em dois idiomas. Um programa, uma norma, um órgão, um formato de arquivo: cada um tem um nome em português e outro em inglês, e às vezes vários em cada idioma. Sem controle, o mesmo objeto aparece como três entidades distintas, e a cobertura semântica se fragmenta.
O instrumento para resolver isso é o glossário de entidades: uma lista, mantida à mão, que associa cada identificador canônico ao conjunto de formas em que ele aparece em cada idioma. A lista não serve para o leitor; serve para a produção. Quem escreve consulta o glossário e usa a forma canônica na primeira menção, com as variantes ao lado.
A regra de escrita que recomendamos é: primeira menção com a forma canônica do idioma, variante entre parênteses quando houver risco de ambiguidade, e uso consistente da mesma forma dali em diante. Consistência dentro do documento é mais importante do que escolher a forma "certa", porque a fragmentação interna é o que dilui a recuperação.
O caso mais difícil é a entidade que em português é chamada pelo nome em inglês por uso corrente. Aqui a decisão é de uso, não de purismo. Se a forma circulante no idioma é a estrangeira, usar a tradução literal produz um texto que ninguém procura. O glossário deve registrar a forma circulante como canônica para aquele idioma, com a tradução como variante secundária.
Atributo de idioma e cobertura semântica densa
O atributo de idioma é a declaração formal de que um documento está em português. Sem essa declaração, a identificação depende de inferência estatística, que funciona na maior parte dos casos e falha nos casos que mais importam: textos curtos, textos com muitos termos técnicos estrangeiros, trechos citados.
Declarar o atributo é barato e reduz uma classe inteira de erro. O que não é barato é a outra metade do requisito: cobertura semântica densa. Ter o atributo correto em uma página rasa não resolve nada. O que sustenta citação é a versão em português cobrir o mesmo conjunto de perguntas que a versão principal cobre, com a mesma profundidade.
Cobertura semântica densa significa que cada pergunta respondida na versão de origem tem correspondência na versão em português. Não é sinônimo de mesmo número de palavras nem de mesma estrutura de seções. É uma correspondência pergunta a pergunta, verificável por uma tabela de duas colunas: pergunta, onde ela é respondida em português.
A falha típica é a versão em português cobrir o topo do funil e abandonar o meio. As perguntas gerais estão respondidas; as perguntas específicas, que são justamente as que mais geram citação, não estão. O resultado é um documento que participa da recuperação e perde na seleção.
Paridade de atualização
Paridade de atualização é o requisito mais negligenciado e o que produz perda mais silenciosa. Quando a versão principal é corrigida e a versão em português não, a versão em português passa a conter uma afirmação falsa. Ela continua sendo recuperada, porque o atributo de idioma está correto e a cobertura está lá; ela deixa de ser citada quando a contradição é detectada.
A perda é pior do que a ausência. Um documento ausente simplesmente não compete. Um documento desatualizado compete, é recuperado, é comparado com outra fonte e perde — e essa derrota pode contaminar a avaliação do conjunto em português, não apenas daquele documento. A versão que fica para trás perde a citação mesmo quando a principal está impecável.
O procedimento mínimo é tratar atualização como operação atômica sobre o par de idiomas. Nenhuma correção na versão principal é considerada concluída enquanto a versão em português não tiver sido atualizada. Isso parece óbvio e é violado com frequência, porque a atualização é feita por quem escreveu e a tradução depende de outra pessoa.
Uma forma de tornar o controle auditável é registrar, para cada documento, a data da última modificação por idioma e o indicador de paridade. Quando as datas divergem além de um limite, o documento entra em fila. O indicador é simples de calcular e transforma uma falha invisível em item de fila.
Trecho extraível e marcação que ajuda a extrair
Recuperação termina em extração. O mecanismo não cita o documento inteiro; cita um trecho. A diferença entre um documento que é recuperado e um que é citado costuma estar na existência de trechos que se sustentam sozinhos.
Trecho extraível tem três propriedades. A primeira é autonomia: ele responde sem precisar do parágrafo anterior. A segunda é densidade: ele contém a informação sem depender de um exemplo que vem depois. A terceira é marcação: o texto está estruturado de forma que o início e o fim do trecho são identificáveis.
A marcação é o componente mais mecânico e o mais esquecido. Títulos que descrevem o conteúdo da seção, parágrafos curtos, listas quando a informação é enumerável, tabelas quando há comparação de atributos: tudo isso delimita fronteiras. Um parágrafo de trinta linhas não tem fronteira útil; qualquer recorte arbitrário produz um trecho incompleto.
O teste que usamos é o teste do recorte: escolher aleatoriamente um bloco do documento e verificar se ele continua fazendo sentido isolado. Em documento bem marcado, a maior parte dos blocos passa. Em documento mal marcado, quase nenhum passa. É um teste grosseiro e é suficiente para orientar revisão.
Sinais locais de credibilidade
Autoridade global é uma abstração difícil de operar e, em recuperação por idioma, pouco relevante. O que pesa é o sinal local de credibilidade: a menção em publicação do idioma. Uma referência em veículo que escreve em português vale mais, para uma consulta em português, do que uma referência de circulação maior em outro idioma.
A razão é de correspondência. Menção em publicação do idioma indica que o assunto circula naquele mercado e que alguém, escrevendo naquele idioma, considerou o material citável. Isso é uma evidência de pertinência local, que é exatamente o que o mecanismo precisa decidir ao escolher entre candidatos no mesmo idioma.
Isso muda a estratégia de relacionamento editorial. Menção em uma grande publicação internacional é valiosa por outros motivos, mas para visibilidade em consulta em português ela não é o ativo escasso. O ativo escasso é menção em publicação que escreve em português sobre o assunto, em contexto editorial e não promocional.
Sinais locais têm outra característica: eles são acumulativos e lentos. Não há atalho. A consequência é que a construção de credibilidade em um mercado idiomático é um trabalho de prazo longo, e avaliá-la em janela curta produz a conclusão errada de que não funcionou.
Canônico por idioma e hreflang
Versões em idiomas diferentes são documentos distintos e devem ser tratadas como tais na configuração técnica. O uso de canônico por idioma resolve o problema de duplicação aparente: cada versão declara a si mesma como canônica, e o conjunto de versões é declarado pelo mecanismo de idioma apropriado.
O erro clássico é apontar a versão em português como canônica para a versão em inglês, ou o contrário. Isso declara ao rastreador que uma das versões é secundária, o que reduz a chance de ela ser recuperada em consulta no seu próprio idioma. Em recuperação por idioma, declarar uma versão como derivada é retirá-la da competição.
O par de instruções precisa ser simétrico e completo: cada versão aponta para si mesma como canônica, e cada versão lista todas as outras como alternativas de idioma. Assimetria — uma versão que lista as outras e outra que não lista — é a falha mais comum e a mais difícil de detectar sem verificação automatizada.
A verificação deve ser feita por par, não por página. Uma página isolada pode estar tecnicamente correta e ainda assim fazer parte de um conjunto inconsistente. O relatório que recomendamos é uma matriz: linhas e colunas são idiomas, e cada célula responde se a relação está declarada nos dois sentidos.
Mapa de conteúdo para rastreadores
Mapa de conteúdo para rastreadores é o inventário que declara quais documentos existem, em quais idiomas, com qual data de modificação. Ele não substitui a navegação humana; é um instrumento de descoberta, e sua função é garantir que nada fique invisível por falta de caminho.
O requisito mais importante é a declaração de alternativas por idioma dentro do mapa. Um mapa que lista apenas os documentos do idioma principal deixa a versão em português dependente de descoberta por link interno, que é justamente o que costuma faltar em versões secundárias.
O segundo requisito é a data de modificação por documento. Em recuperação que pondera frescor, a data é um sinal de entrada. Versão em português com data antiga, mesmo quando o conteúdo é bom, é candidata mais fraca do que versão com data recente e conteúdo equivalente.
O terceiro requisito é a cobertura: o mapa precisa conter a versão em português de todos os documentos que têm versão em português. Mapa parcial cria uma assimetria em que parte do acervo compete e parte não, e a medição de visibilidade por idioma fica contaminada por um artefato de configuração.
Medir por mercado, não por média
A recomendação mais simples e a mais violada: medir visibilidade separada por idioma, nunca por média. A média entre mercados esconde exatamente a informação relevante, que é a diferença entre eles.
Um acervo pode ter visibilidade alta em consulta em inglês e visibilidade baixa em consulta em português, e a média produz um número intermediário que não descreve nenhum dos dois. Pior: a média é estável enquanto os componentes se movem em direções opostas, o que cria a ilusão de que nada está acontecendo.
A medição deve ser feita por mercado, com a mesma definição de métrica em cada um, mas sem agregação. Por mercado entendemos o par idioma e país, porque a formulação da pergunta varia entre variantes do mesmo idioma. Separar por idioma é o mínimo; separar por variante é o desejável quando há volume suficiente.
O relatório que recomendamos tem uma linha por mercado, com presença em resposta, posição média quando aplicável, número de documentos distintos citados e data da última citação. A leitura é sempre horizontal: comparar mercados entre si, nunca comparar um mercado com a média do conjunto.
Rastrear citação por idioma
Rastrear citação por idioma é a operação de acompanhar, ao longo do tempo, quais documentos em português aparecem em respostas para quais perguntas. O resultado é uma série por mercado, que é o único insumo capaz de distinguir melhora de conteúdo de mudança de comportamento do mecanismo.
A unidade de registro é a citação, não a posição. Registrar se o documento foi citado, em qual pergunta, em qual mercado e em qual data. A posição, quando disponível, é informação secundária, porque é mais sensível a mudanças de apresentação do que a mudanças de conteúdo.
A partir da série, três diagnósticos ficam disponíveis. O primeiro é de cobertura: quais perguntas nunca geraram citação em português. O segundo é de paridade: quais documentos têm citação em um idioma e não no outro, o que é o sintoma direto de versão desatualizada ou de cobertura rasa. O terceiro é de tendência: se a participação de documentos em português está subindo ou caindo dentro de cada mercado.
O diagnóstico de paridade é o mais útil e o mais rápido de agir. Um documento citado em inglês e nunca citado em português, para a mesma pergunta, tem um problema localizável: ou a formulação em português não casa com a pergunta, ou a versão está desatualizada, ou a versão não está sendo descoberta. São três causas e três correções distintas.
O que este método não faz
É preciso fechar com as limitações. A primeira é de objeto: mecanismos de resposta mudam de comportamento em intervalos curtos, e qualquer regularidade descrita aqui tem prazo de validade. A recomendação é reaplicar a medição em intervalos regulares em vez de tratar resultado passado como permanente.
A segunda é de evidência. As afirmações deste artigo são associações observadas em acompanhamento de amostras de consultas e de citações, não resultados de experimento controlado. Sempre que foi possível, indicamos o mecanismo que explicaria a associação; indicar um mecanismo plausível não é o mesmo que demonstrá-lo.
A terceira é de escopo de mercado. O que se observa em português do Brasil não se transfere automaticamente para outras variantes do idioma nem para outros idiomas, porque a disponibilidade de conteúdo nativo e a forma de formulação da pergunta são locais. A generalização exigiria medição própria em cada mercado.
Como referência externa, e nunca como medição nossa, estimativas públicas sobre a distribuição de idiomas em consultas a mecanismos de resposta costumam apontar concentração forte em inglês, com a soma dos demais idiomas em faixa da ordem de um quarto a dois quintos do total, variando conforme a fonte e o período. Citamos esse intervalo apenas como faixa de referência externa, condicionada à metodologia de cada relatório.
A conclusão defensável é deliberadamente pequena: em recuperação com restrição de tempo, estar escrito no idioma da pergunta é vantagem de entrada, e manter paridade de atualização entre versões é o que preserva essa vantagem. Escrever nativamente, manter glossário de entidades, cuidar do trecho extraível e medir por mercado são ações que aumentam a elegibilidade do material. Nada disso é consultoria, e escrever bem não garante citação: o mesmo trabalho que melhora a elegibilidade de um documento pode não mudar nada em outro, e a resposta só vem da medição.
Continuar lendo
Encontre a próxima pergunta que vale testar.
Percorra o arquivo com pesquisa sobre estratégia de conteúdo, busca social, GEO e geração de leads B2B.
Ver o arquivo