O comentário como documento de esforço

Reagir a uma publicação custa um toque. Comentar custa uma frase, e uma frase exige que alguém formule uma necessidade em palavras. Nas superfícies da Meta, essa diferença de custo é o que transforma o comentário em algo mais parecido com um documento do que com uma métrica. Uma reação é um voto sem conteúdo; um comentário é um voto com texto, e texto é examinável.

Para quem pesquisa comportamento de compradores, a distinção importa porque a maior parte do que se mede em mídia social é barata de produzir e por isso mesmo ruidosa. O alcance, a impressão, a reprodução e a reação são eventos de baixo atrito: acontecem em escala, mas dizem pouco sobre por que aconteceram. O comentário é o primeiro nível de sinal em que a pessoa precisa gastar tempo e se expor publicamente. Esse gasto é uma espécie de filtro.

É preciso desde já colocar o limite do que se está afirmando. Ler comentários como amostra de demanda não é consultoria, e também não é um método que produza uma conclusão sobre o mercado. É um método de leitura de texto escrito por desconhecidos, em um ambiente que não foi desenhado para pesquisa, com viés de seleção enorme. Serve para gerar perguntas e para organizar atenção, não para fechar diagnóstico.

A primeira consequência prática dessa escolha é aceitar que a amostra é enviesada por construção. Quem comenta em uma página do Facebook, em uma publicação do Instagram ou em um grupo não representa quem compra, nem quem considera, nem quem ignora. Representa quem comenta. Todo o valor do método está em saber descrever esse recorte com precisão suficiente para não extrapolar além dele.

Por que comentar seleciona outra população

A reação e o comentário diferem em três dimensões: custo cognitivo, exposição e expectativa de resposta. O custo cognitivo é o esforço de transformar uma impressão em frase. A exposição é o fato de que o comentário fica visível com nome e foto, ao passo que a reação se dilui em um número agregado. A expectativa de resposta é o que faz alguém escrever em vez de apenas concordar: quem comenta, com frequência, espera alguma coisa de volta, seja uma resposta, seja o reconhecimento dos outros participantes.

Essas três dimensões empurram a população de comentadores em uma direção previsível. Sobrepesam-se pessoas com uma pergunta não resolvida, pessoas insatisfeitas com algum detalhe e pessoas que gostam do ambiente o bastante para conversar nele. Sub-representam-se os silenciosos, que em muitos mercados são a maioria, e os que resolvem a dúvida por outro caminho, como busca, indicação ou conversa privada.

Na prática, isso significa que o comentário é bom para responder à pergunta: o que as pessoas não entenderam. É fraco para responder: quantas não entenderam. A pergunta de quantidade precisa de outra fonte, e confundir as duas é o erro mais comum nesse tipo de leitura.

Há um segundo efeito de seleção que merece registro. Comentários são públicos e acumuláveis, então cada novo comentário se escreve depois de ler os anteriores. Isso produz contágio de tema e de tom. Uma crítica com muitas reações puxa outras críticas na mesma direção; uma dúvida já respondida tende a reaparecer em palavras parecidas. A série não é uma coleção de observações independentes, e qualquer contagem que a trate como tal superestima a concordância.

Comentário em anúncio e comentário orgânico não são a mesma população

Uma das separações mais negligenciadas é a entre comentário em anúncio e comentário orgânico. Eles chegam à mesma caixa de entrada, muitas vezes na mesma ferramenta, e por isso tendem a ser tratados como uma coisa só. Não são.

O comentário em anúncio vem de uma entrega direcionada. A pessoa recebeu aquele conteúdo porque um sistema de entrega decidiu que ela era receptiva, o que significa que o conjunto de comentadores já passou por um filtro de segmentação antes de escrever. Além disso, o contexto é diferente: a pessoa não foi até a página, a página foi até ela. Isso muda o tipo de pergunta que aparece, com mais questionamento sobre a credibilidade do que está sendo exibido e mais reação ao formato.

O comentário orgânico vem de quem já estava no ambiente. Foi até a página, seguiu a conta, abriu o grupo. Essa pessoa tem mais histórico de relação com aquela presença e, por isso, produz perguntas de outro tipo: mais sobre uso, menos sobre legitimidade.

Misturar as duas populações em um único indicador destrói a informação mais interessante de cada uma. Se o objetivo é entender o que não foi compreendido por quem ainda não conhece, o comentário em anúncio é o material. Se o objetivo é entender o que já é usado e onde trava, o comentário orgânico é o material. A separação deve ser feita na coleta, não na análise, porque depois de misturadas as origens raramente são recuperáveis com segurança.

Vale abrir o parêntese de cautela. Essa distinção se apoia na lógica de entrega das plataformas, não em um estudo próprio. Ao usar ordens de grandeza vindas de terceiros, é obrigatório declarar fonte, período e amostra; aqui não há estatística sendo apresentada, apenas a descrição do mecanismo que produz o viés.

Classificar por tipo de pergunta: três estados do comprador

Uma vez separadas as origens, a classificação mais útil não é por sentimento, e sim por tipo de pergunta. Sentimento diz como a pessoa falou; tipo de pergunta diz em que ponto ela está. Uma taxonomia mínima de três estados resolve a maior parte dos casos.

O primeiro estado é a pergunta de quem ainda não comprou. Ela se reconhece porque o comentário pede o básico: o que é, para quem serve, se funciona, onde se encontra. Há ausência de vocabulário técnico e presença de dúvida sobre legitimidade. Esse comentário é evidência de demanda não atendida na comunicação, e o que ele indica é uma lacuna de explicação.

O segundo estado é a pergunta de quem já usa. Aqui o comentário pressupõe o produto ou serviço e questiona o detalhe: compatibilidade, duração, configuração, caso específico, exceção. É o material mais valioso para pauta técnica e para identificar o ponto onde a promessa encontra a prática. Custa mais caro de obter por outras vias e costuma estar concentrado em grupos, onde o usuário fala com outro usuário.

O terceiro estado é a pergunta de comparação. Ela menciona alternativas, pede diferenças ou relata troca. É o tipo mais raro e o mais sensível à manipulação de contexto, porque a comparação é frequentemente estimulada pelo próprio conteúdo publicado.

Um comentário qualificado é aquele que cai em um desses três estados e contém informação suficiente para ser reescrito como pergunta de pesquisa. Comentários de apoio, elogio vago, marcação de terceiros e repetição de texto do próprio post não são qualificados para essa classificação, embora tenham valor para outras métricas. A definição precisa ser escrita antes da leitura, porque é ela que torna a contagem replicável.

Comentário repetido e agrupar perguntas por tema

Com as perguntas separadas por estado, o passo seguinte não é contar. É agrupar perguntas por tema. Duas pessoas escrevendo frases diferentes podem estar formulando a mesma dúvida, e uma contagem por unidade de comentário vai tratá-las como dois assuntos distintos.

Agrupar perguntas por tema resolve isso e produz o que interessa: o conjunto de dúvidas recorrentes. O procedimento é simples de descrever e exige cuidado na execução. Lê-se o comentário, reescreve-se a dúvida em uma frase canônica, sem jargão, e essa frase é o rótulo do grupo. Quando outro comentário chega, compara-se com os rótulos existentes antes de criar um novo. O rótulo cresce em volume, não em variedade.

O comentário repetido é o indicador operacional mais honesto desse método. Um tema que reaparece trinta vezes em um mês e reaparece de novo no mês seguinte não é moda; é uma dúvida estrutural daquela categoria. O que muda é a redação, não o problema. Quando a dúvida muda de redação e continua reconhecível, a classificação está funcionando.

Um detalhe importante: o grupo deve registrar também de onde veio o comentário. Um tema que só aparece em anúncio tem interpretação diferente do mesmo tema só em conteúdo orgânico. No primeiro caso, é falha de clareza na mensagem dirigida a quem não conhece; no segundo, é dificuldade de uso de quem já conhece. São ações diferentes para a mesma dúvida.

Tempo até a primeira resposta como métrica operacional

Volume classificado é o retrato. Para acompanhar o processo, a métrica mais informativa é o tempo até a primeira resposta: o intervalo entre a publicação de um comentário com pergunta e a primeira resposta útil, seja da própria página, seja de outro participante.

O intervalo é informativo por dois motivos. Primeiro, ele mede a capacidade de atenção da operação, que é um recurso limitado e disputado. Segundo, e mais importante para pesquisa, ele altera o próprio dado. Uma pergunta respondida em dez minutos não gera os cinco comentários seguintes pedindo a mesma coisa. Uma pergunta respondida em dois dias gera uma cadeia de repetições que infla o tema artificialmente. Ou seja, parte do volume de comentário repetido é consequência do atraso da resposta, não da intensidade da dúvida.

Por isso, a série de tempo até a primeira resposta precisa ser registrada junto com a série de temas. Sem ela, um aumento de comentários sobre determinado assunto pode ser apenas a mesma dúvida crescendo porque ninguém respondeu.

Em grupos, a métrica muda de sentido. Em muitos casos, quem responde primeiro é outro participante, e a qualidade da resposta é variável. Registrar quem respondeu primeiro é tão importante quanto registrar quando. Uma resposta de participante resolve a dúvida do ponto de vista de quem pergunta, mas não corrige o material da organização, então a dúvida continuará reaparecendo para a próxima pessoa.

Sentimento automatizado: onde o classificador erra

A tentação seguinte é classificação de sentimento automatizada. É útil como triagem em volume grande, e é perigosa quando vira número de relatório. A lista de erros é conhecida e se repete em português do Brasil.

O primeiro erro é a ironia. Uma frase curta de elogio exagerado diante de um problema relatado é lida como positiva e significa o oposto. Não há solução robusta: modelos treinados em texto geral erram em ironia local, e errar aqui é pior do que não classificar, porque o erro é silencioso.

O segundo erro é a expressão regional. O português do Brasil varia bastante por região, e parte do vocabulário afetivo é local. Uma palavra neutra em um estado é ofensa em outro; um elogio comum em uma região é lido como frieza em outra. Um classificador treinado em corpus geral não captura essa variação, e o resultado é um viés geográfico disfarçado de sentimento.

O terceiro erro é a negação e a dúvida. Perguntas bem-educadas escritas na negativa costumam ser classificadas como negativas sem que haja reclamação alguma. É um caso particular do problema mais geral de que pergunta não é opinião.

O quarto erro é o tamanho. Comentários muito curtos, com uma ou duas palavras, não têm material para classificação. Atribuir sentimento a um texto de duas palavras é inventar informação.

A conclusão prática é que o sentimento automatizado deve ser usado apenas como primeira passagem, para ordenar fila e reduzir o volume a ser lido por gente. Ele define prioridade de leitura, não resultado.

Revisão humana por amostra como método registrado

Se o classificador só define prioridade, o resultado depende de alguém ler. E como não se lê tudo, o que se lê precisa ser uma amostra definida antes, sorteada de forma reproduzível. É a revisão humana por amostra, e o valor do método está no registro, não na leitura em si.

O procedimento mínimo tem quatro elementos. Tamanho da amostra por estrato, definido por origem e por tipo de pergunta. Regra de sorteio escrita, com semente ou posição, para que outra pessoa possa sortear de novo e chegar ao mesmo subconjunto. Protocolo de classificação, com os três estados e os rótulos de tema, aplicado por leitor humano. E registro do desacordo entre leitores, quando houver mais de um.

A amostra revisada manualmente é o que permite afirmar alguma coisa com honestidade. Não sobre a população inteira, porque a população inteira é enviesada, mas sobre o procedimento: é possível dizer quantos dos comentários classificados como pergunta de quem ainda não comprou eram de fato isso. Esse número é a qualidade do instrumento, e deve ser reportado junto com qualquer número derivado dele.

Um cuidado adicional: a revisão humana introduz deriva. O mesmo leitor classifica diferente em semanas diferentes, sem perceber. A forma barata de controlar isso é manter um conjunto fixo de comentários de referência, relidos periodicamente, para medir a estabilidade do próprio critério. Se o acordo cai, o problema está no protocolo, e não nos dados.

Ruído, spam e bots: o que sai antes de contar

Uma fração grande dos comentários não é sinal de nada além de automação. Antes de qualquer classificação, o material precisa passar por uma triagem de ruído e spam, e essa triagem precisa ser descrita porque é ela que define o denominador.

O que entra como ruído é relativamente objetivo: repetição do texto do post sem acréscimo, sequência de emojis, marcação em massa de outras pessoas, link solto, oferta não solicitada e texto genérico intercambiável entre posts diferentes. Cada um desses tipos deve ter uma regra de exclusão escrita de antemão.

Bots são mais difíceis. Há sinais sugestivos, como cadência anormal, texto idêntico em dias diferentes e contas sem histórico, mas nenhum é conclusivo isolado. A recomendação metodológica é conservadora: em caso de dúvida, exclui-se e contabiliza-se a exclusão. O número de comentários descartados por suspeita de automação entra no relatório como linha própria. Assim, quem lê o resultado sabe o quanto do volume original sobreviveu ao filtro.

O ponto que costuma ser esquecido é que o ruído não é distribuído de forma uniforme. Ele se concentra em anúncios de grande alcance e em posts que ficaram muito tempo no ar sem moderação. Uma conta que cruze anúncio e orgânico sem ajustar por isso vai atribuir ao orgânico um nível de spam que pertence ao outro grupo.

Taxa de falsos positivos e o custo de uma pauta errada

Todo filtro automático tem dois erros, e eles não custam o mesmo. O falso negativo é uma pergunta real jogada fora; o custo é perder uma pauta que existia. O falso positivo é um item sem conteúdo que entra na contagem; o custo é produzir uma pauta sobre uma dúvida que ninguém tem.

A taxa de falsos positivos é a medida que importa monitorar, porque é ela que contamina o resultado. Uma taxa de falsos positivos desconhecida transforma qualquer número de tema em ficção. Por isso a estimativa dela deve vir da mesma amostra revisada manualmente, e deve ser reportada por tipo de item, não em média geral: o filtro costuma errar pouco em elogio e muito em pergunta curta.

Vale fazer a conta do custo. Suponha um exercício hipotético e explicitamente ilustrativo, sem base empírica: mil comentários coletados, trezentos classificados como pergunta, amostra de cem revisada, vinte e cinco confirmados como não pergunta. A taxa observada de falsos positivos nessa amostra é de vinte e cinco por cento, e a estimativa de perguntas reais passa de trezentos para algo em torno de duzentos e vinte e cinco, com intervalo de incerteza que depende do tamanho da amostra. O número apurado é bem menor que o número bruto, e a diferença é exatamente o que a triagem automática não conseguiu ver. Esse exemplo é um modelo de cálculo, não um resultado de campo, e serve apenas para mostrar por que o denominador precisa ser reestimado.

O efeito downstream é o que torna a métrica relevante. Uma pauta construída sobre uma dúvida inexistente consome produção, publicação e atenção de quem lê, e ainda cria a ilusão de que o tema foi investigado. Errar para o lado de produzir menos é, nesse arranjo, mais barato do que errar para o lado de produzir mais.

Quando o volume de comentários é a meta errada

A última armadilha é institucional, não técnica. Quando a caixa de entrada passa a ser acompanhada como indicador, a tendência é transformar volume de comentários em meta. É o caminho mais curto para destruir o valor da fonte.

O problema é que volume é fácil de inflar e o que o infla costuma ser exatamente o que não interessa. Perguntas polêmicas geram comentário e não geram demanda. Erros propositais geram comentário e corroem confiança. Chamar atenção para um detalhe irrelevante gera comentário e desloca a conversa do que importava. Se a métrica for volume, todos esses movimentos são racionais e todos pioram a amostra.

O mesmo vale para o incentivo à resposta. Se o tempo até a primeira resposta virar meta isolada, a solução passa a ser responder rápido e mal, o que aumenta o comentário de retorno e reduz a qualidade do dado seguinte. Uma métrica de processo precisa ser acompanhada de uma métrica de qualidade, ou ela se volta contra o que mede.

As metas defensáveis nesse arranjo são as que medem o instrumento: proporção da amostra confirmada por revisão humana, taxa de falsos positivos por tipo, estabilidade entre leitores e número de temas novos identificados por mês. Nenhuma delas cresce quando a conversa piora, que é a propriedade que se deseja de uma métrica.

Como registrar a série para ela ser comparável

Fechar o método exige disciplina de registro, porque a utilidade do comentário como amostra aparece na comparação no tempo, e comparação só funciona se o procedimento não mudou no meio.

O registro mínimo por item coletado é: origem, se anúncio ou conteúdo orgânico; superfície, se página do Facebook, perfil do Instagram ou grupo; data e hora local da publicação e do comentário; tipo de pergunta; rótulo de tema; quem respondeu primeiro; intervalo até essa resposta; se o item foi excluído e por qual regra. Sem esses campos, qualquer variação na série seguinte é ambígua, e a reação natural é inventar uma explicação.

A disciplina de registro também protege contra a leitura seletiva. Um tema que cresce em um mês e cai no seguinte raramente é uma mudança de mercado; com mais frequência é uma mudança de publicação, de horário, de formato ou de moderação. Quem mantém a série com os mesmos campos percebe isso. Quem lê comentário por comentário, sem registro, vê narrativa onde há apenas variação do instrumento.

Convém terminar com a ressalva que deveria abrir e fechar todo esse tipo de trabalho. A caixa de entrada da Meta é uma amostra conveniente e barata de uma população que não foi sorteada para representar ninguém. O que o método oferece é rigor na descrição do recorte, não alcance. Um conjunto de perguntas reais, classificadas com protocolo estável e revisadas por amostra, é material suficiente para decidir o que investigar por outras vias. A leitura de comentários não garante que a dúvida encontrada seja a dúvida dominante, nem que o tema escolhido seja o mais relevante para quem pesquisa. Garante apenas que a pergunta existe, foi escrita por alguém e pode ser verificada por outra pessoa com o mesmo protocolo. Em pesquisa de comportamento, isso é pouco, e já é mais do que a maioria das fontes de mídia social oferece.

Continuar lendo

Encontre a próxima pergunta que vale testar.

Percorra o arquivo com pesquisa sobre estratégia de conteúdo, busca social, GEO e geração de leads B2B.

Ver o arquivo