Técnico
Algoritmo BERT do Google: o que ele entende
Saiba como o BERT do Google entende contexto e intenção de busca, por que ele importa para SEO em português e como criar conteúdo B2B mais preciso.
Por Marco Antonio Claro Santos · Fundador e estrategista de SEO B2B da MarkSaint.

Em outubro de 2019 o Google publicou um exemplo que resumia o problema melhor que qualquer explicação técnica: a busca "2019 brazil traveler to usa need a visa". Antes do BERT, o sistema ignorava a preposição "to" e devolvia resultados sobre cidadãos americanos viajando ao Brasil — o inverso exato do que a pessoa queria.
A palavra que mudava tudo tinha duas letras. Este artigo explica o que o BERT faz, por que ele importou mais em português do que em inglês, como ele se encaixa entre os outros sistemas de linguagem do Google, e o que isso muda na forma de escrever conteúdo B2B.
O que é o algoritmo BERT do Google?
BERT é um sistema de processamento de linguagem natural que interpreta cada palavra considerando todas as outras da frase, nas duas direções, em vez de ler da esquerda para a direita. Isso permite entender o papel de preposições, negações e conectivos, que mudam o sentido de uma consulta sem mudar as palavras principais.
A documentação oficial o descreve como "an AI system Google uses that allows us to understand how combinations of words express different meanings and intent".
O que significa bidirecional
Modelos anteriores processavam a sequência em uma direção. Ao chegar em uma palavra, o sistema tinha o contexto do que veio antes, e não do que viria depois.
O BERT lê a frase inteira de uma vez. O papel de cada palavra é definido pelo conjunto completo em que ela aparece. Para consultas curtas com muitas palavras funcionais — que é como as pessoas escrevem quando fazem perguntas reais — isso muda o resultado.
A arquitetura
Transformers, com mecanismo de atenção que pondera a relação entre todas as palavras da sequência simultaneamente. É a mesma família de arquitetura que deu origem aos modelos de linguagem que escrevem texto hoje, aplicada aqui à compreensão e não à geração.
O Google publicou o BERT como pesquisa aberta em 2018, antes de aplicá-lo à busca. Boa parte do avanço de NLP da década seguinte partiu desse trabalho.
Quais exemplos o Google deu para explicar o BERT?
Os cinco exemplos do anúncio de 2019 são o melhor material didático disponível, porque cada um isola uma classe diferente de erro de interpretação.
Consulta | A palavra que muda tudo | O erro anterior |
|---|---|---|
"2019 brazil traveler to usa need a visa" | to | Devolvia o fluxo inverso de viagem |
"do estheticians stand a lot at work" | stand | Confundia com "stand-alone" |
"can you get medicine for someone pharmacy" | for someone | Ignorava que era para terceiro |
"parking on a hill with no curb" | no | Trazia resultados sobre meio-fio existente |
"math practice books for adults" | for adults | Trazia material de ensino fundamental |
O padrão comum
Em todos os casos, as palavras de conteúdo estavam corretas e o sentido estava invertido. Preposição, negação e delimitador de público são as três classes que mais quebravam.
Por que isso importa para B2B
Consultas comerciais são cheias dessas armadilhas. "Fornecedor de X para indústria alimentícia" e "fornecedor de X da indústria alimentícia" são necessidades diferentes. "Software de gestão sem mensalidade" e "software de gestão com mensalidade" invertem com uma palavra.
Antes do BERT, o comprador que escrevia a pergunta com precisão era punido por isso. Depois, a precisão passou a ser recompensada.
O BERT teve efeito maior em português?
O anúncio indica que sim, para featured snippets. Pandu Nayak escreveu: "For featured snippets, we're using a BERT model to improve featured snippets in the two dozen countries where this feature is available, and seeing significant improvements in languages like Korean, Hindi and Portuguese."
Por que o ganho foi maior fora do inglês
Duas razões plausíveis.
A primeira é linguística. Português tem mais riqueza de preposição e contração que o inglês, mais flexão verbal, e uma ordem de palavras mais flexível. "Curso para gestante" e "curso de gestante" carregam relações diferentes que um sistema unidirecional achata.
A segunda é de base de treino. Modelos anteriores tinham muito mais material em inglês, então o desempenho em outras línguas partia de um patamar mais baixo — havia mais espaço para melhorar.
O que isso significa para conteúdo em português
Que traduções literais de material em inglês perderam vantagem, e que escrever em português nativo passou a valer mais. Quando o sistema entende relação gramatical, texto que soa traduzido perde para texto que soa escrito.
Como o BERT se encaixa entre os outros sistemas?
Ele não substituiu nada. A documentação oficial lista, entre os sistemas ativos, BERT, MUM, Neural Matching, RankBrain e Passage Ranking System — cada um com função declarada distinta.
Sistema | Descrição oficial |
|---|---|
BERT | Entende como combinações de palavras expressam significados e intenções diferentes |
RankBrain | Ajuda a entender como palavras se relacionam a conceitos |
MUM | Capaz de entender e gerar linguagem, multitarefa |
Neural Matching | Entende representações de conceitos em consultas e páginas e as associa |
Passage Ranking | Identifica seções individuais de uma página |
A camada de ranqueamento
O testemunho de Pandu Nayak no processo antitruste acrescentou um nome que não aparece na documentação pública: o DeepRank, descrito como o BERT aplicado ao ranqueamento, incorporando capacidades do RankBrain e treinado em dados de usuário com refino em dados de avaliação.
Um documento citado no processo afirma que o DeepRank vincula o ranqueamento mais firmemente ao campo da compreensão de linguagem.
O testemunho descreveu ainda o RankEmbed BERT, lançado inicialmente sem BERT e depois ampliado com ele, treinado em documentos, cliques e consultas, com a função de identificar documentos além dos encontrados pela recuperação tradicional.
A leitura prática dessa arquitetura
O ranqueamento não tem um dono. Compreensão de consulta, recuperação de candidatos, reordenamento e montagem da página de resultados são etapas com sistemas próprios.
Isso explica por que "otimizar para o algoritmo X" nunca funcionou: não existe um algoritmo para otimizar.
Dá para otimizar para o BERT?
Não. A posição do Google sobre isso é a mesma que vale para o RankBrain: não há como otimizar para esses sistemas, porque eles interpretam significado em vez de verificar a presença de elementos.
O que efetivamente ajuda
Escrever a relação de forma explícita. Se o produto é para um público específico, dizer qual. Se a condição tem exceção, nomear a exceção. O sistema lê relação — texto que deixa a relação implícita entrega menos.
Preferir frase direta a frase longa com subordinadas encadeadas. Não por limitação do modelo, mas porque ambiguidade sintática no texto vira ambiguidade de interpretação.
Usar a formulação que o usuário usa. Incluindo as preposições. Um H2 escrito como "Preço de X para pequena empresa" corresponde melhor a uma consulta real que "Preços — X".
Tratar cada seção como autocontida. Com o Passage Ranking identificando seções individuais, uma resposta que depende de três parágrafos anteriores tem menos chance de ser recuperada isoladamente.
O que não ajuda
Densidade de palavra-chave. Irrelevante para um sistema que trabalha com representação de significado.
Listas de entidades e sinônimos empilhadas. Encher o texto de variações não melhora compreensão, piora leitura.
Marcação especial. Não há schema, atributo ou arquivo que sinalize intenção para esses sistemas. A documentação de AI features é explícita: não é preciso criar arquivos legíveis por máquina ou marcação para participar.
Reescrever tudo em linguagem simples. Precisão técnica não atrapalha. O que atrapalha é imprecisão.
Como escrever conteúdo B2B que o BERT interpreta bem?
Seis práticas que decorrem do mecanismo.
1. Qualificar o sujeito e o destinatário
"Manutenção preventiva para compressor de parafuso em operação contínua" carrega três qualificadores que definem a necessidade. "Manutenção preventiva" sozinho corresponde a tudo e a nada.
2. Nomear a negação em vez de omiti-la
Conteúdo técnico costuma tratar o caso em que a regra não vale de forma implícita. Dizer "isso não se aplica quando o equipamento opera abaixo de X" dá ao sistema — e ao leitor — uma informação que a omissão não dá.
3. Escrever H2 como a pergunta é feita
Com preposição, com o delimitador de público, com o modificador. "Quanto custa X para indústria de pequeno porte?" corresponde a uma consulta real.
4. Responder logo abaixo do H2
Resposta direta de 40 a 60 palavras, autocontida. Serve ao Passage Ranking, ao featured snippet e à extração por sistemas de IA.
5. Evitar pronome ambíguo em cadeia
"Ele" e "isso" referindo-se a algo mencionado dois parágrafos antes obrigam qualquer leitor — humano ou sistema — a reconstruir a referência. Repetir o substantivo custa uma palavra e resolve.
6. Escrever em português nativo
Estruturas traduzidas do inglês soam certas e leem errado. Dado o ganho declarado do BERT em português, conteúdo escrito na língua tem vantagem sobre conteúdo traduzido.
Como diagnosticar um problema de interpretação?
Três sinais que aparecem em dados que você já tem.
1. Impressão em consultas com sentido invertido
Se o Search Console mostra impressões para consultas que significam o oposto do que sua página entrega, o texto está deixando a relação ambígua. É o sintoma mais direto.
2. CTR baixo em consultas de alta correspondência
Quando a consulta corresponde bem ao tema e o clique não vem, com frequência o título promete um recorte diferente do que a página trata.
Antes de concluir, separe as consultas com AI Overview, já que o CTR na posição 1 cai 58% na presença do bloco, segundo a análise da Ahrefs sobre 300 mil palavras-chave.
3. Featured snippet perdido para conteúdo mais fraco
Quando um concorrente com menos autoridade ocupa o snippet, normalmente a diferença é de formato: a resposta dele é autocontida e a sua depende do contexto anterior.
O que veio depois do BERT?
O BERT foi o começo de uma família, não o ponto final. A documentação oficial lista hoje vários sistemas de linguagem ativos ao mesmo tempo.
MUM
Descrito como "Multitask Unified Model (MUM) is an AI system capable of both understanding and generating language". Anunciado como muito mais capaz que o BERT, com a diferença central de ser multitarefa: entende e gera, e trabalha através de formatos e idiomas.
O efeito visível em busca foi discreto e deliberado. O Google aplicou MUM a casos específicos antes de ampliar.
Neural Matching
"An AI system that Google uses to understand representations of concepts in queries and pages and match them to one another." Opera na associação entre a representação da consulta e a do documento, camada distinta da interpretação da frase.
Passage Ranking
"An AI system we use to identify individual sections or 'passages' of a web page." Permite que uma seção específica de uma página longa seja recuperada por mérito próprio.
A camada generativa
AI Overviews e AI Mode são a superfície mais recente, e a documentação os trata separadamente dos sistemas de ranqueamento. Para participar, a exigência declarada é estar indexado e elegível para snippet, sem requisito adicional nem marcação especial.
A continuidade técnica entre BERT e essa camada é direta: a mesma família de arquitetura que aprendeu a interpretar a frase aprendeu depois a escrevê-la.
Quais erros de escrita atrapalham a interpretação?
Sete padrões comuns em conteúdo B2B que criam ambiguidade evitável.
1. Título nominal sem relação explícita
"Manutenção — Compressores" não diz o que se faz, para quem, ou em qual condição. "Como fazer manutenção preventiva em compressor de parafuso" diz.
2. Pronome referindo-se a algo distante
"Ele" apontando para um substantivo mencionado dois parágrafos antes obriga a reconstrução da referência. Repetir o substantivo resolve.
3. Negação implícita
Conteúdo técnico tende a tratar a exceção por omissão. Escrever "isso não se aplica a equipamentos abaixo de 10 CV" entrega informação que a omissão não entrega.
4. Público não nomeado
"A solução ideal para sua operação" não delimita nada. "Para operações com até 50 pontos de coleta" delimita.
5. Frase longa com subordinadas encadeadas
Três orações subordinadas em sequência criam mais de uma leitura possível. Duas frases resolvem.
6. Jargão interno sem o termo de mercado
Se o setor chama de uma coisa e a empresa de outra, o conteúdo precisa das duas formas — não por densidade, por correspondência com a pergunta feita.
7. Resposta que depende do parágrafo anterior
Com avaliação por passagem, seção que só faz sentido em sequência perde a chance de ser recuperada isolada. Cada seção precisa se sustentar.
Perguntas frequentes sobre o BERT
O BERT substituiu o RankBrain?
Não. A documentação oficial lista os dois como sistemas ativos e distintos.
BERT é o mesmo que MUM?
Não. MUM é descrito como multitarefa e capaz de entender e gerar linguagem. BERT trata de compreensão.
O BERT afeta o português do Brasil?
Sim. O anúncio citou ganhos expressivos em featured snippets em português entre as línguas destacadas.
Preciso mudar meu conteúdo por causa do BERT?
Não como projeto. O que compensa é revisar títulos e H2 para que carreguem os qualificadores da necessidade.
O BERT é usado em AI Overviews?
A documentação trata os sistemas de ranqueamento e os recursos de IA separadamente. Para AI Overviews, a exigência declarada é estar indexado e elegível para snippet, sem requisitos adicionais.
Conteúdo curto é penalizado?
Não existe extensão mínima. Uma das perguntas de autoavaliação do Google é justamente se você está escrevendo para atingir uma contagem de palavras que imagina ser preferida.
O BERT não mudou o que é bom conteúdo. Ele reduziu a distância entre escrever bem e ranquear bem, ao passar a ler o texto do jeito que um leitor lê — com as preposições, as negações e os qualificadores fazendo o trabalho que sempre fizeram.
Para conteúdo B2B em português, isso favorece quem escreve com precisão sobre o que conhece. Descobrir onde o seu conteúdo está sendo lido de forma diferente da pretendida exige análise por consulta. A MarkSaint faz essa leitura no diagnóstico inicial. Peça seu diagnóstico gratuito e receba o mapa das consultas em que seu conteúdo está sendo interpretado fora do alvo.
Fontes
Google — Understanding searches better than ever before (Pandu Nayak, 25/10/2019)
Google Search Central — A Guide to Google Search Ranking Systems
Google Search Central — Creating helpful, reliable, people-first content
Search Engine Land — FAQ: All about the BERT algorithm in Google search
Search Engine Land — How Google Search and ranking works, according to Google's Pandu Nayak