Tudo o que sua empresa sabe,pronto para seus agentes pesquisarem.

Contratos, planilhas, calls e repositórios viram uma base privada que um agente investiga página por página e cita.

Fontes
25+ formatos, além de páginas web e repositórios
Parsing
No Auto, ou no método que você escolher
Fundamentação
Cada afirmação ligada a uma página
Interfaces
REST, SDKs Python e TS, MCP
POST /ask-sourcesthinking_level: accurate
pergunta
Qual é o prazo de aviso de rescisão no contrato da Marumbi?
list_sourcesquery="marumbi msa" → 3 arquivos candidatos
grep_in_sourcespattern="rescisão|aviso" → 11 ocorrências
get_pages_markdowncontrato-marumbi.pdf pages=[14]
verifyaditivo-2.pdf substitui §8.2
60 dias de aviso por escrito, reduzidos para 30 se a infração não for corrigida. O prazo de 90 dias da §8.2 foi substituído pelo Aditivo 2.
contrato-marumbi.pdf · p.14aditivo-2.pdf · p.3
Ferramentas
semantic_searchgrep_in_sourcesget_pages_markdownanalyze_visualsget_sections_markdownlist_sources_with_metadataget_tabular_rowsget_elementextract_full_fileget_pages_infoget_dataset_infoget_tabular_headersget_elements_info_from_pageget_sections_infoopen_artifactget_total_pagessemantic_searchgrep_in_sourcesget_pages_markdownanalyze_visualsget_sections_markdownlist_sources_with_metadataget_tabular_rowsget_elementextract_full_fileget_pages_infoget_dataset_infoget_tabular_headersget_elements_info_from_pageget_sections_infoopen_artifactget_total_pages

O agente investiga antes de responder.

Uma única consulta vetorial devolve o que estiver mais próximo e torce para estar certo. O Graphor DocumentAI roda um loop de ferramentas de verdade: restringe os arquivos, busca por semântica e por regex, abre as páginas que precisa, manda os gráficos para um modelo de visão e reconcilia o que se contradiz.

get_dataset_info · list_sources_with_metadata01 / 06

Filtrar

Antes de buscar qualquer coisa, o agente filtra o conjunto até os arquivos que podem ter a resposta, usando nomes, anotações do documento e metadados.

→ 1.204 arquivos → 6 candidatos

Você decide até onde ele vai.

Cada requisição carrega um nível de esforço, e o nível é um orçamento real: quanta busca o agente pode fazer antes de ter que responder com as evidências que já reuniu. Consultas simples continuam baratas. Perguntas difíceis ganham a profundidade que precisam.

fast

Busca curta

Vai direto no arquivo mais provável, lê as páginas que importam e responde. Para perguntas em que você já sabe mais ou menos onde está a resposta.

profundidaderasa
balanced

O equilíbrio

Dá tempo de confirmar o achado numa segunda fonte antes de responder, sem transformar toda pergunta em investigação.

profundidademédia
accurate

Perguntas compostas

Para perguntas que passam por muitos arquivos e várias sub-respostas, onde evidência parcial é pior do que resposta nenhuma.

profundidadealta
max

Investigação

Reconciliar documentos que se contradizem, ou auditar um corpus inteiro para achar o que está faltando.

profundidadeexaustiva

Ir mais fundo não custa coerência: memória observacional e compactação inline mantêm a trilha de evidências intacta, então uma investigação longa continua lembrando o que encontrou no início.

Onde um RAG comum quebra.

A maioria dos times coloca 80% de um sistema de retrieval no ar em uma semana e passa seis meses nos 20% que faltam. Esta é a parte dos seis meses.

Busca vetorial simples
Graphor DocumentAI
Estratégia de busca
Uma consulta vetorial por pergunta e o top-k por distância de cosseno.
Um loop de ferramentas: filtra os arquivos, depois busca semântica, grep por regex, leitura de páginas e chamadas de visão, pelo tempo que a pergunta exigir.
Correspondência exata
Embeddings misturam códigos, datas e números de cláusula com os vizinhos.
Regex Python completo sobre as fontes, em lote entre arquivos e paginado além das dez primeiras ocorrências.
Tabelas
Achatadas em texto, então linhas e cabeçalhos deixam de bater.
Fontes tabulares lidas por cabeçalho e linha; tabelas partidas entre páginas são recompostas.
Gráficos e escaneados
Invisíveis. Se não é texto, não está no índice.
Páginas e elementos renderizados vão para um modelo de visão com uma pergunta específica, até oito por vez.
Contradições
Os dois trechos são recuperados; o modelo faz a média e entrega uma resposta errada com confiança.
Conflitos são expostos e resolvidos seguindo as referências entre documentos.
Buscas longas
O contexto lota e os primeiros achados caem fora da janela.
Memória observacional e compactação inline mantêm a trilha de evidências intacta por mais fundo que a busca vá.
Procedência
IDs de trecho, se você tiver guardado.
Cada afirmação carrega arquivo, página e passagem. O que não tem respaldo é marcado, não inventado.
Depuração
Uma caixa preta em que você reescreve o prompt até parecer certo.
As respostas vêm com as páginas que as sustentam, então uma resposta errada aponta para o parsing ou para a fonte, não para um chute.

Cinco formas de ler o mesmo documento.

Deixe o Auto rotear cada página para o método capaz de lê-la, ou escolha um dos quatro na mão. Cada execução é versionada: compare métodos no mesmo arquivo e troque a versão ativa sem subir nada de novo.

Auto

roteamento por página

O Auto classifica cada página primeiro e manda cada trecho para o método mais barato que dá conta de ler. Um único ajuste para documentos que são quase todos texto simples, com algumas páginas que não são.

Recupera
Páginas simples ficam no parser barato
Tabelas, digitalizações e gráficos sobem de nível sozinhos
Cobrado pelo detalhamento real, nunca por uma tarifa fixa de Auto
Disponível para PDFs
Um documento de 20 páginas
1–6
Fasttexto simples
7
Accuratetabela aninhada
8–15
Fasttexto simples
16–17
Agenticgráfico escaneado
18–20
Fasttexto simples
cobrado: 17 Fast · 1 Accurate · 2 Agentic0 páginas cobradas como Auto

25+ formatos

PDF, Office, HTML, CSV/XLSX, imagens, áudio e vídeo, todos por uma única chamada de ingest.

Web e crawl

Aponte para uma URL e, se quiser, siga os links dela para capturar uma árvore inteira de documentação.

Repositórios GitHub

Aponte para um repositório e o código e a documentação dele ficam pesquisáveis junto dos seus documentos.

Calls e vídeo

Áudio e vídeo são transcritos, então o que foi dito numa reunião pode ser consultado como um documento.

Peça um texto.Ou peça uma tabela.

Defina os campos que você quer e a Graphor devolve JSON estruturado para um lote inteiro, com a página de onde veio cada valor. Mesmo agente, outro formato de saída, e ele entrega um CSV ou markdown quando você pede para exportar.

Schema
numero_notatextoIdentificador único da nota fiscal
data_emissaotextoData da nota em YYYY-MM-DD
valor_totalnúmeroValor total devido
itenslistaDescrição, quantidade e preço unitário por linha
assinado_portextoNome no bloco de assinatura, se houver

As instruções seguem em linguagem natural:"use YYYY-MM-DD para datas e BRL para valores."

extract → 47 documentosprocedência por página
numero_nota: "NF-2318"p.1
data_emissao: "2026-05-14"p.1
valor_total: 48120.00p.3
itens: [ 14 itens ]p.2–3
num_pedido: "PED-8841"p.1
assinado_por: "M. Andrade"p.4
47 linhas · 0 campos sem resolver→ invoices-q2.csv

Da pasta à resposta citada, em uma chamada.

Tudo no produto é um endpoint: ingest, reprocess, list, get elements, retrieve chunks, extract, ask. SDKs em Python e TypeScript, mais um servidor MCP com 12 ferramentas para o seu agente de código consultar a base direto.

pip install graphor

from graphor import Graphor

client = Graphor()                    # lê GRAPHOR_API_KEY

with open("contrato-marumbi.pdf", "rb") as f:
    build = client.sources.ingest_file(file=f, partition_method="auto")

file_id = aguardar_conclusao(client, build.build_id)   # get_build_status()

res = client.sources.ask(
    question="Which contracts auto-renew before September?",
    file_ids=[file_id],
)

print(res.answer)
for c in res.citations:
    print(f"{c.file_name} p.{c.page_number}")

Traga seu próprio modelo

Agentes Claude, GPT, Gemini e Cerebras compartilham um único schema de ferramentas. Contas Enterprise podem rodar o agente na própria chave da Anthropic.

Citações por padrão

Cada resposta devolve o arquivo, a página e a passagem por trás de cada afirmação, então uma resposta ruim é algo que você rastreia em vez de adivinhar.

Builds versionados

Reprocesse uma fonte com outro método e compare. Só o build ativo serve o retrieval, e a troca é instantânea.

O que os times já perguntam a ele.

Jurídico

"Quais destes 400 contratos renovam automaticamente antes de setembro, e qual aviso cada um exige?"

Contratos, aditivos e termos apartados, em que o aditivo derruba a cláusula que você teria achado primeiro.
Financeiro

"A apresentação para investidores contradiz as demonstrações auditadas em algum ponto?"

Um gráfico de slide contra uma tabela na página 31, uma comparação que só um modelo de visão faz.
Engenharia

"Como o rate limiting foi implementado, e onde isso está documentado?"

Um repositório do GitHub mais o site de docs, ingeridos juntos e pesquisados como um só corpus.
Seguros

"Quais sinistros deste lote estão sem o laudo médico obrigatório?"

Processos escaneados em que a resposta é a falta de um documento, não o conteúdo dele.
Compras

"Extraia toda nota acima do valor do pedido num CSV que eu possa mandar para o financeiro."

Uma extração em lote que termina num arquivo para baixar, não numa resposta de chat.
Pesquisa com clientes

"O que os clientes disseram sobre o onboarding no último trimestre?"

Gravações de call, tickets e threads de e-mail, transcritos e pesquisados por tema.

Seus documentos não treinam nossos modelos.

Compromissos contratuais de não treinar em toda a cadeia de provedores, isolamento de tenant em cada camada e um Trust Center que declara a postura sem rodeios, inclusive o que ainda não é certificado.

Sem treino no seu conteúdo

Compromissos contratuais de não treinar com todos os provedores de modelo da cadeia, repassados no DPA.

Isolamento de tenant

Isolamento imposto nas camadas de aplicação, banco, storage e token de API, não por convenção.

Retenção que você controla

Retenção documentada por categoria de dado, com mecanismos de exclusão que atendem ao art. 18 da LGPD e aos arts. 15–22 do GDPR.

Residência de dados

Regiões declaradas para cada componente do ambiente de produção, com o regime de transferência explicitado.

SLA de 72h para incidentes

Um processo escrito de resposta a incidentes, com matriz de escalonamento e compromisso de post-mortem.

Status de compliance honesto

Certificações herdadas dos subprocessadores listadas ao lado dos controles compensatórios onde ainda não existe certificação formal.

Lista de subprocessadores, modelo de DPA e detalhes de residência noTrust Center.

Comece pela sua pior pasta.

Traga um documento que hoje exige quarenta páginas de leitura e uma pergunta que ninguém responde rápido. Em trinta minutos você vê o agente rodando nele, e não em uma demo genérica.

Respondemos em até um dia útil.
Na call
01Você descreve os documentos e as perguntas que precisa responder com eles.
02Rodamos o agente em um caso seu, com o método de parsing que aquele material pede.
03Você sai com uma leitura honesta do que dá e do que não dá para fazer hoje.