Topologia da Informação da IA
Descubra como a IA utiliza informação com a MarkSaint.
Prévia do projeto
Pular para o conteúdoA IA não consulta documentos. Ela constrói contexto.
Sistemas de IA não “compreendem” uma base de conhecimento como um humano. Eles operam sobre representações estruturadas e vetoriais da informação e combinam metadados, entidades, relações, relevância lexical, similaridade semântica, regras de acesso, histórico e modelos probabilísticos para selecionar contexto e decidir como responder ou agir.
Modelo inadequado · repositório documental passivo
- Arquivos soltos
- Pastas
- Busca por palavra
- Leitura manual
- Decisão humana isolada
O conhecimento existe, mas não é localizável por significado, não carrega proveniência e não pode ser filtrado por permissão ou validade.
Modelo orientado por IA
- Conteúdo estruturado
- Entidades e relações
- Embeddings semânticos
- Recuperação híbrida
- Contexto selecionado
- LLM, agente ou workflow
- Resposta rastreável
A base inteira não vai para o modelo
Um LLM não precisa receber toda a base de conhecimento. Precisa do trecho certo, na hora certa.
Localizar, filtrar, ranquear, compactar
O sistema precisa encontrar, filtrar por permissão e validade, ordenar e reduzir o contexto ao mais relevante.
Estrutura vale mais que volume
A qualidade da resposta depende menos do tamanho bruto da base e mais de estrutura, recuperação, proveniência e governança.
Contexto irrelevante custa caro
Aumenta custo, latência, risco de erro e a chance de instruções conflitantes. Modelos usam pior a informação perdida no meio de contextos longos.
Da nota à resposta
Acompanhe uma única nota de conhecimento atravessar as nove etapas até virar uma resposta com fontes. Use Reproduzir, as setas ou clique em qualquer etapa.
Graph View não é Knowledge Graph
As mesmas notas, lidas de dois jeitos. Alterne a visualização: no Graph View a posição vem de forças físicas; no grafo de conhecimento, o significado está no tipo do nó e na direção da relação.
| Abordagem | Unidade principal | Vantagem | Limitação | Papel proposto |
|---|
Oito tipos de nó, nove relações
Relações tipadas tornam dependências explícitas. Cada tipo tem uma finalidade computável e um conteúdo mínimo obrigatório.
Regras ontológicas
- R1Todo
decisionpossui ao menos uma relaçãoderived_fromcomevidence. - R2Todo
processexecutável égovernspor uma ou maispolicy. - R3Todo
agentpossuirequiresou referência explícita àscapabilityque satisfaz. - R4Toda relação
writesaponta para umsystemou artefato autorizado. - R5Toda
goalpossui ao menos uma relaçãomeasured_by. - R6Evidência expirada pode ser recuperada para histórico, mas não sustenta automaticamente uma recomendação atual.
- R7Contradições não são apagadas: permanecem explícitas e vão para o avaliador.
Validador de aresta
Monte uma relação e veja se ela respeita o domínio e o destino do catálogo.
Arestas inversas são geradas pelo indexador, não duplicadas manualmente. Ex.: policy governs process gera a projeção consultável process governed_by policy.
| Relação | Domínio recomendado | Destino recomendado | Semântica | Inversa gerada |
|---|
A nota torna-se entidade computável
Clique em qualquer linha do frontmatter para ver o que ela significa e quem a consome. relations e provenance ficam como listas de valores atômicos porque a interface de Propriedades do Obsidian não suporta bem propriedades aninhadas.
Campos complementares recomendados
schema_versionversão do contrato semânticostatusdraft · review · approved · deprecated · quarantinedsupersedesID do registro substituídoretention_classpolítica de retençãojurisdictionrestrições geográficas ou regulatóriasapproved_byidentidade do aprovadorapproved_atdata da aprovaçãosource_languageidioma original da evidênciaAntes do embedding: como o conteúdo é preparado
O sistema não precisa gerar um embedding por página inteira. A unidade recuperável costuma ser um trecho (chunk) com sentido próprio, enriquecido com metadados e um ID persistente.
Blocos de sentido
Dividir por blocos semânticos, não apenas por contagem arbitrária de caracteres. Evitar frases isoladas e assuntos misturados.
Contexto preservado
Preservar título, subtítulo, entidades, fonte, data e URL canônica. Acrescentar ao trecho o contexto do documento reduz falhas de recuperação.
Sobreposição controlada
Usar sobreposição só quando ela preserva continuidade de sentido. Sobreposição demais duplica contexto e custo.
Estruturas especiais
Tabelas, listas, FAQs, citações, definições e procedimentos têm comportamento próprio e não devem ser cortados no meio.
IDs persistentes
Documento, seção, chunk e versão recebem IDs estáveis, para citar, auditar e invalidar embeddings quando a fonte muda.
Metadados filtráveis
Intenção, idioma, sensibilidade, status e validade acompanham o chunk e permitem filtrar antes de ranquear.
Embeddings: como a IA transforma significado em proximidade
Embeddings são representações numéricas densas de textos, imagens, produtos, usuários ou outros objetos em um espaço vetorial. Objetos de significado parecido tendem a ficar próximos.
Consulta
Projeção 2D ilustrativa de vetores de 9 dimensões (uma por conceito). Os scores de cosseno são calculados de fato sobre esses vetores; modelos reais usam centenas ou milhares de dimensões aprendidas.
Similaridade de cosseno
- q é o vetor da consulta; d, o vetor de um documento ou chunk.
- Valores maiores indicam maior alinhamento semântico (o ângulo entre os vetores é menor).
- O score vetorial isolado não deve ser a única regra de decisão.
O que o vetor é, e o que ele não é
- Cada conteúdo vira um vetor de números. Não é uma lista de palavras-chave.
- A distância entre vetores estima similaridade de significado.
Por que a melhor recuperação não depende só de vetores
Cada sinal acerta onde o outro falha. Em avaliações fora do domínio de treino, o BM25 continua um baseline difícil de superar, enquanto modelos densos capturam paráfrases.
| Sinal de recuperação | Resolve melhor | Limitações |
|---|---|---|
| Busca lexical / BM25 | Termos exatos, códigos, marcas, URLs, nomes próprios, erros e siglas | Não entende bem paráfrases e sinônimos |
| Busca vetorial | Intenção, contexto, sinônimos, paráfrases e proximidade semântica | Pode recuperar conteúdo semanticamente parecido, mas factualmente inadequado |
| Grafo / topologia | Relações explícitas, dependências, hierarquias, políticas e proveniência | Exige modelagem e manutenção |
| Metadados / filtros | Data, autor, domínio, idioma, sigilo, status, jurisdição e acesso | Não resolve relevância por si só |
| Reranker | Reordenação mais precisa do conjunto candidato | Opera após a primeira recuperação e adiciona custo e latência |
Comparador de recuperação ·
Corpus de 30 documentos e gabarito de relevância definidos para esta demonstração. As métricas são calculadas sobre esse conjunto; não são benchmarks de mercado.
Simulador de busca híbrida
Reciprocal Rank Fusion
A RRF combina posições nos rankings, não scores brutos, porque o score do BM25 e a similaridade de cosseno estão em escalas diferentes e não são comparáveis. O valor k = 60 vem do artigo original.
Embeddings aumentam recall semântico. Busca lexical preserva precisão literal. Topologia protege contexto relacional. Reranking melhora a decisão final.
O que exatamente o modelo recebeu, e por quê
O pacote de contexto entregue ao modelo para a consulta selecionada, com fonte, data, scores, permissão, tipo de relação e justificativa de inclusão. Os itens excluídos também ficam registrados.
| # | Trecho / fonte | Data | BM25 | Cosseno | RRF | Rerank | Permissão | Relação | Decisão e justificativa |
|---|
Como cada motor generativo busca, escolhe e cita
Google, Gemini, Copilot, ChatGPT, Claude, Perplexity, Grok, Meta AI e DeepSeek seguem o mesmo esqueleto (decidir se busca, decompor a pergunta, recuperar, selecionar, sintetizar e citar), mas diferem na fonte dos dados, em quem decide buscar e nos rastreadores que o publisher controla. O Manus entra como contraponto: é um agente que navega a web como um usuário, sem índice de busca próprio.
Rastreadores e controles do publisher
| Motor | Treino de modelos | Índice / busca | Acesso acionado pelo usuário | Observação |
|---|
Bloquear o rastreador de treino não tira o site das respostas com busca, e bloquear o de busca não impede o uso para treino. São decisões separadas no robots.txt.
Ser rastreável pelo bot certo
Cada motor tem um rastreador próprio para busca. Bloqueá-lo remove o site das respostas daquele motor.
Responder subperguntas
Com fan-out e buscas sucessivas, uma página pode ser recuperada por uma subconsulta, não pela pergunta original. Cobertura de subtemas importa.
Trechos autocontidos e citáveis
Os motores citam trechos. Afirmação clara, fonte e data no mesmo bloco facilitam a citação.
Fontes de terceiros
Mídia conquistada e comparativos independentes pesam mais que o conteúdo da própria marca.
Tempo real muda o jogo
Grok usa posts do X; Perplexity e motores com busca privilegiam conteúdo atual. Sem busca, vale a memória do modelo, com data de corte.
Agentes navegam como pessoas
Agentes como o Manus abrem páginas num navegador real. Site rápido, HTML acessível e informação legível sem login viram requisito.
Controle por página no Bing
NOARCHIVE e NOCACHE ajustam o uso no Copilot sem tirar a página da busca clássica.
Medir por motor
Fontes, rastreadores e modelos diferem. A visibilidade precisa ser medida em cada plataforma, com repetição.
GEO: otimização para ser recuperado, compreendido e citado por IA
GEO (Generative Engine Optimization) é uma disciplina complementar ao SEO técnico e editorial, voltada a aumentar a probabilidade de uma marca, fonte ou conteúdo ser recuperado e citado em respostas geradas por mecanismos de IA. Não substitui SEO.
Matriz de GEO · 7 pilares
Teste de elegibilidade para citação
Clique em cada critério para alternar entre ausente, parcial e presente. O índice é heurístico e serve para priorizar trabalho editorial; não é uma probabilidade de citação.
Como a IA decide recomendar uma marca
Uma recomendação de marca é uma síntese probabilística de duas fontes: o que o modelo aprendeu no treino e o que ele recupera no momento da pergunta. Nenhuma das duas é um ranking fixo, e a resposta varia entre execuções, plataformas e formulações.
Anatomia de uma recomendação
Marcas, fontes e resposta são fictícias e servem só para ilustrar o mecanismo.
Quatro fatores que moldam a recomendação
Presença
A marca aparece nas fontes que o modelo aprendeu ou recuperou para essa categoria? Sem presença, não há candidato.
Associação
Com qual categoria, segmento e atributos a marca é descrita, de forma consistente, em fontes diferentes?
Consenso
Fontes independentes concordam? Mídia conquistada e comparativos de terceiros pesam mais que o discurso da própria marca.
Adequação
A marca atende às restrições da pergunta (porte, preço, integração, região)? Pequenas diferenças de avaliação podem mudar a escolha.
Recomendação é distribuição, não posição
A mesma pergunta, feita 20 vezes, produz respostas diferentes. Uma medição isolada não diz nada; o indicador útil é a taxa de menção com sua margem de erro.
Simulação com probabilidades fixas definidas para a demonstração. Margem aproximada de 95%: ±1,96·√(p(1−p)/n).
O que um backlink ou um release realmente entrega à IA
Backlinks e releases agem por três canais diferentes: o ranking da busca clássica, a recuperação feita por mecanismos de IA com busca e o texto que entra no treino dos modelos. Um mesmo sinal pode ser forte em um canal e quase nulo em outro.
Busca clássica
Links continuam sinal de descoberta e de autoridade, na linhagem do PageRank. Links pagos precisam de rel="sponsored" ou "nofollow".
IA com recuperação
O mecanismo busca páginas e sintetiza. Ser recuperado depende do índice e do ranking; ser citado depende de a fonte ser de terceiros e confiável.
Memória do modelo
O modelo aprende texto, não o grafo de links. Conta a menção da marca em contexto. Cópias quase idênticas tendem a ser deduplicadas no treino.
Mapa de sinais · selecione um sinal
avaliação qualitativa baseada nas fontes, não mediçãoO que acontece depois que um release é publicado
- Texto idêntico publicado em dezenas ou centenas de sites
- Links geralmente nofollow ou sponsored
- Anchor otimizado em release distribuído é listado como link spam
- Cópias quase idênticas tendem a ser deduplicadas no treino
- A fonte continua sendo a própria marca
- O release traz dado original, estudo ou fato noticioso
- O jornalista apura e escreve matéria própria
- Link editorial e menção em contexto, com categoria e atributos
- Fonte de terceiros, do tipo que a IA prefere citar
- Texto independente, que não é removido como duplicata
O que fazer
- Usar o release como pauta com dado original, não como ferramenta de link building.
- Em releases e conteúdo pago, usar o nome da marca ou a URL como anchor e marcar o link com rel="sponsored".
- Priorizar menções nas fontes que os mecanismos citam para a categoria: imprensa especializada, comparativos, associações e reviews autênticos.
- Descrever a marca de forma consistente (categoria, segmento, atributos) em todas as fontes.
- Consolidar a entidade: página Sobre, Organization com sameAs e perfis oficiais.
- Medir por amostragem repetida de perguntas, por plataforma.
O que evitar
Topical authority como topologia editorial
Autoridade temática não é volume de conteúdo nem repetição de palavras-chave. É cobertura organizada de uma entidade, com relações úteis entre as páginas. Exemplo: o cluster “GEO e IA para empresas”.
Página pilar
Define a entidade e distribui para o aprofundamento.
Aprofundamento
Responde perguntas informacionais específicas.
Consideração
Comparativos e objeções (GEO vs SEO, GEO vs AEO).
Decisão
Casos, evidências proprietárias e conversão.
O Obsidian como ambiente de autoria da topologia
O Obsidian pode funcionar como ambiente de autoria, curadoria e versionamento de uma topologia de conhecimento. Entretanto, indexação vetorial, retrieval, permissões, orquestração, execução e observabilidade devem ser implementados por uma camada operacional externa.
O que essa estrutura permite
- Melhor descoberta interna.
- Recuperação contextual para agentes.
- Reutilização do conhecimento em conteúdo, vendas, atendimento e produto.
- Geração de briefings, FAQs, páginas pilar e clusters.
- Auditoria da origem de afirmações.
- Atualização controlada de informações desatualizadas.
- Separação entre conhecimento público, interno, confidencial e restrito.
--- (com *** o Obsidian não o reconhece como propriedades); e relations e provenance aninhados são YAML válido para o pipeline, mas a interface de Propriedades do Obsidian não os edita plenamente. Resumo da arquitetura empresarial
O Obsidian não executa modelos, agentes, ferramentas nem fluxos transacionais. Um pipeline externo valida o schema, resolve entidades, constrói índices lexicais, vetoriais e topológicos e publica uma representação adequada para recuperação e controle. Quando surge uma demanda, o Context Router identifica entidades, aplica permissões, seleciona evidências e políticas vigentes, percorre só relações permitidas e monta um pacote compacto de contexto, que define agentes, ferramentas, modelo e pontos de aprovação humana.
Três níveis para o board
A proposta cria contexto preciso sem transformar o Obsidian em runtime. A tese é válida, mas vem com um limite obrigatório e um princípio de controle que não se negocia.
A topologia direciona a operação
Uma topologia semântica governada pode direcionar recuperação, seleção de agentes, exposição de ferramentas e pontos de aprovação.
Links são sinais, não garantias
Links e propriedades do Obsidian não impõem segurança nem garantem verdade. São sinais semânticos consumidos por serviços externos.
Relação não é autoridade
Nenhuma relação presente no cofre concede autoridade operacional sem IAM, Policy Decision Point e credenciais de curta duração.
Cinco decisões computáveis
A topologia não serve para olhar. Ela precisa produzir cinco decisões que um sistema consegue executar e auditar.
D1Escopo de conhecimento
Quais metas, processos, decisões, evidências e políticas estão relacionadas à solicitação.
D2Composição da equipe
Quais agentes possuem as capacidades exigidas pelos processos ativados.
D3Exposição de ferramentas
Quais sistemas cada agente pode ler ou alterar.
D4Nível de autonomia
Quais ações são automáticas e quais exigem aprovação.
D5Memória e retenção
Quais resultados podem ser persistidos, por quanto tempo e com qual classificação.
Modelo causal recomendado
- Demanda empresarialobjetivo, prazo, formato de saída
- Entidades resolvidasaliases → IDs canônicos
- Subgrafo autorizadoACL projetada antes da recuperação
- Políticas + capacidades + sistemas
- Equipe hierárquica de IA
- Plano e ferramentas permitidas
- Crítica independente
- Execução automática ou decisão humanaconforme classe de autonomia A0–A4
Seis camadas separam autoria, inteligência e execução
O Control Plane atravessa todas as camadas: identidade, política e auditoria valem para cada chamada, não só para o início da sessão. Selecione uma camada para ver suas responsabilidades.
Simulador de ativação: o Context Router entrega só o necessário
Simulação do pipeline JIT sobre o subgrafo de cada cenário. Ajuste a profundidade, compare a projeção de permissões e aperte o orçamento de tokens. Clique em qualquer nó para ver owner, validade, confiança e proveniência.
Consumo do orçamento
Pipeline JIT · 13 etapas
prontoRecuperação e evidências
Equipe ativada
Ferramentas expostas
Aprovações obrigatórias
Ficha de execução · 10 perguntas respondidas a cada demanda
Pacote de contexto gerado
O Context Router produz dois resultados distintos: contexto para raciocínio e contrato de autoridade. Conteúdo relevante não implica permissão para agir.
Pontuar relevância, confiança e risco
Mova os pesos e veja o reranqueamento do cenário ativo. O mesmo score decide quem sobrevive ao corte de orçamento no console acima.
Pesos
Ranking ·
nós autorizadosMCP, A2A e APIs resolvem problemas diferentes
MCP equipa agentes com ferramentas, APIs e recursos. A2A permite descoberta, delegação e troca de resultados entre agentes independentes. Nenhum dos dois é protocolo universal.
Qual usar? Assistente rápido
Regra executiva
O MCP é camada de integração e troca de contexto, não orquestrador corporativo. O host da aplicação continua responsável por composição de contexto, escolha de modelo, política de execução e experiência de aprovação. Em março de 2026 o A2A v1.0 foi anunciado como estável, com múltiplos bindings (JSON sobre HTTP, gRPC, JSON-RPC), negociação de versão, multi-tenancy e Agent Cards assinados.
A topologia seleciona a equipe
Cada nível tem modelo, ferramentas e limites próprios. O crítico fica isolado do executor; o gateway humano tem a palavra final sobre ações materiais. Os papéis ativos no cenário atual aparecem destacados.
Regras de isolamento
Qualidade, custo e soberania na mesma conta
A regra FinOps não é usar sempre o modelo mais barato. É usar o modelo de menor custo que satisfaça o nível de risco e qualidade exigido, e escalar por incerteza, conflito, baixa confiança ou falha de avaliação.
Decisão do roteador
Critérios considerados pelo roteador
- Complexidade cognitiva
- Quantidade e sensibilidade do contexto
- Necessidade de tool use
- Latência máxima
- Custo estimado
- Capacidade multilíngue ou multimodal
- Residência e soberania dos dados
- Taxa histórica de aprovação do modelo naquela tarefa
- Disponibilidade de modelos privados ou locais
Quatro cenários, quatro perfis de risco
O mesmo mecanismo ativa nós, equipes e controles diferentes conforme a demanda. Selecione o cenário para ver o fluxo e os controles.
| Tipo de demanda | Nós ativados | Equipe de IA | Autonomia | Decisão humana |
|---|
Autonomia cresce só com controles comprovados
Escolha o nível concedido e veja o que acontece com cada ação do cenário ativo. A4 sempre exige aprovação humana. A3 só é habilitada após testes adversariais, observabilidade e rollback comprovado.
Pré-requisitos para A3
Ações do cenário ·
O Obsidian facilita; o pipeline garante
A integridade não fica a cargo do editor. Rode o pipeline sobre um cofre de amostra e veja o que bloqueia o merge e o que vira alerta.
Verificações do pipeline
Cofre de amostra · 9 notas
aguardando execuçãoSegurança precede recuperação
O NIST AI RMF organiza o risco em Govern, Map, Measure e Manage; o perfil de IA generativa amplia a atenção para confabulação, privacidade e ataques. A taxonomia OWASP para aplicações agentic aponta onde o Control Plane precisa conter.
Owners, alçadas, políticas, taxonomia, comitê e accountability.
Finalidade, usuários, sistemas, dados, riscos e impactos de cada workflow.
Precisão, groundedness, segurança, custo, latência e taxa de intervenção.
Mitigação, aprovação, resposta a incidentes, rollback e melhoria contínua.
Categorias OWASP agentic em foco
Matriz de riscos · clique para ver a contenção
O sistema tem limites deliberados
O que esta arquitetura explicitamente não fará.
Falhas de concepção · vire o cartão
Medir recuperação, geração, eficiência e visibilidade
Quatro grupos de indicadores. Cada métrica indica de onde vem o dado: observável nos logs próprios, dependente de avaliação (gabarito, revisão humana ou juiz automatizado) ou dependente de dados de terceiros. Não há benchmarks inventados.
Definições de recuperação
De onde vem cada afirmação
Prioridade: documentação oficial, artigos revisados e preprints reconhecidos, documentação técnica, fontes primárias de empresas e, só como complemento, fontes secundárias. Cada item informa data, tipo de evidência, limitação e nível de confiança. Os marcadores [n] ao longo da página abrem a ficha da fonte.
| # | Afirmação | Fonte | Data | Tipo | Limitação | Confiança |
|---|
Afirmações que esta aplicação evita
O piloto evolui por gates, não por promessa
Arraste o cursor de dias ou selecione uma fase. Marque os critérios de cada gate; o progresso fica salvo neste navegador.
ROI contra baseline real
Fórmula de ROI sem projeções fabricadas. Os valores são ilustrativos: substitua pelo baseline do piloto (horas humanas, custo de modelos, infraestrutura, governança, retrabalho e incidentes).
Calculadora de ROI valores ilustrativos
ROI = economia operacional + perdas evitadas + ganho de capacidade − custo totalcusto total
Roteiro em 20 slides
Clique em um slide para abrir o modo apresentação (setas navegam, Esc fecha).
Cinco decisões objetivas ao board
Sponsor, equipe, escopo, gates e critérios Go/No-Go. Registre cada decisão.
Questionário: o que você levou desta jornada
Dezessete perguntas cobrindo os capítulos. Cada resposta mostra a explicação e o link para a seção correspondente. O progresso fica salvo neste navegador.
