Tudo o que sua empresa sabe,pronto para seus agentes pesquisarem.
Contratos, planilhas, calls e repositórios viram uma base privada que um agente investiga página por página e cita.
POST /ask-sourcesthinking_level: accuratelist_sourcesquery="marumbi msa" → 3 arquivos candidatosgrep_in_sourcespattern="rescisão|aviso" → 11 ocorrênciasget_pages_markdowncontrato-marumbi.pdf pages=[14]verifyaditivo-2.pdf substitui §8.2O agente investiga antes de responder.
Uma única consulta vetorial devolve o que estiver mais próximo e torce para estar certo. O Graphor DocumentAI roda um loop de ferramentas de verdade: restringe os arquivos, busca por semântica e por regex, abre as páginas que precisa, manda os gráficos para um modelo de visão e reconcilia o que se contradiz.
get_dataset_info · list_sources_with_metadata01 / 06Filtrar
Antes de buscar qualquer coisa, o agente filtra o conjunto até os arquivos que podem ter a resposta, usando nomes, anotações do documento e metadados.
Você decide até onde ele vai.
Cada requisição carrega um nível de esforço, e o nível é um orçamento real: quanta busca o agente pode fazer antes de ter que responder com as evidências que já reuniu. Consultas simples continuam baratas. Perguntas difíceis ganham a profundidade que precisam.
fastBusca curta
Vai direto no arquivo mais provável, lê as páginas que importam e responde. Para perguntas em que você já sabe mais ou menos onde está a resposta.
balancedO equilíbrio
Dá tempo de confirmar o achado numa segunda fonte antes de responder, sem transformar toda pergunta em investigação.
accuratePerguntas compostas
Para perguntas que passam por muitos arquivos e várias sub-respostas, onde evidência parcial é pior do que resposta nenhuma.
maxInvestigação
Reconciliar documentos que se contradizem, ou auditar um corpus inteiro para achar o que está faltando.
Ir mais fundo não custa coerência: memória observacional e compactação inline mantêm a trilha de evidências intacta, então uma investigação longa continua lembrando o que encontrou no início.
Onde um RAG comum quebra.
A maioria dos times coloca 80% de um sistema de retrieval no ar em uma semana e passa seis meses nos 20% que faltam. Esta é a parte dos seis meses.
Cinco formas de ler o mesmo documento.
Deixe o Auto rotear cada página para o método capaz de lê-la, ou escolha um dos quatro na mão. Cada execução é versionada: compare métodos no mesmo arquivo e troque a versão ativa sem subir nada de novo.
Auto
roteamento por páginaO Auto classifica cada página primeiro e manda cada trecho para o método mais barato que dá conta de ler. Um único ajuste para documentos que são quase todos texto simples, com algumas páginas que não são.
Fast
baseado em regrasParticionamento por regras com o mínimo de custo. O padrão certo para documentos limpos, feitos de texto, que você já controla.
Balanced
layout + OCRParsing ciente de layout com OCR. Dá conta de páginas escaneadas e PDFs de várias colunas, onde a ordem de leitura na tela não é a ordem do texto em disco.
Accurate
modelos fine-tunedModelos de layout com fine-tuning para documentos especializados. Feito para arquivos financeiros, jurídicos e cheios de formulários, onde uma célula lida errado é uma resposta errada.
Agentic
precisão máximaUm pipeline agêntico que olha a página como uma pessoa olharia, com embeddings visuais sobre a página renderizada. Para documentos em que o sentido está no layout, não no texto.
Um documento de 20 páginas1–678–1516–1718–20cobrado: 17 Fast · 1 Accurate · 2 Agentic0 páginas cobradas como Auto25+ formatos
PDF, Office, HTML, CSV/XLSX, imagens, áudio e vídeo, todos por uma única chamada de ingest.
Web e crawl
Aponte para uma URL e, se quiser, siga os links dela para capturar uma árvore inteira de documentação.
Repositórios GitHub
Aponte para um repositório e o código e a documentação dele ficam pesquisáveis junto dos seus documentos.
Calls e vídeo
Áudio e vídeo são transcritos, então o que foi dito numa reunião pode ser consultado como um documento.
Peça um texto.Ou peça uma tabela.
Defina os campos que você quer e a Graphor devolve JSON estruturado para um lote inteiro, com a página de onde veio cada valor. Mesmo agente, outro formato de saída, e ele entrega um CSV ou markdown quando você pede para exportar.
numero_notatextoIdentificador único da nota fiscaldata_emissaotextoData da nota em YYYY-MM-DDvalor_totalnúmeroValor total devidoitenslistaDescrição, quantidade e preço unitário por linhaassinado_portextoNome no bloco de assinatura, se houverAs instruções seguem em linguagem natural:"use YYYY-MM-DD para datas e BRL para valores."
extract → 47 documentosprocedência por páginanumero_nota: "NF-2318"p.1data_emissao: "2026-05-14"p.1valor_total: 48120.00p.3itens: [ 14 itens ]p.2–3num_pedido: "PED-8841"p.1assinado_por: "M. Andrade"p.447 linhas · 0 campos sem resolver→ invoices-q2.csvDa pasta à resposta citada, em uma chamada.
Tudo no produto é um endpoint: ingest, reprocess, list, get elements, retrieve chunks, extract, ask. SDKs em Python e TypeScript, mais um servidor MCP com 12 ferramentas para o seu agente de código consultar a base direto.
pip install graphor
from graphor import Graphor
client = Graphor() # lê GRAPHOR_API_KEY
with open("contrato-marumbi.pdf", "rb") as f:
build = client.sources.ingest_file(file=f, partition_method="auto")
file_id = aguardar_conclusao(client, build.build_id) # get_build_status()
res = client.sources.ask(
question="Which contracts auto-renew before September?",
file_ids=[file_id],
)
print(res.answer)
for c in res.citations:
print(f"{c.file_name} p.{c.page_number}")Traga seu próprio modelo
Agentes Claude, GPT, Gemini e Cerebras compartilham um único schema de ferramentas. Contas Enterprise podem rodar o agente na própria chave da Anthropic.
Citações por padrão
Cada resposta devolve o arquivo, a página e a passagem por trás de cada afirmação, então uma resposta ruim é algo que você rastreia em vez de adivinhar.
Builds versionados
Reprocesse uma fonte com outro método e compare. Só o build ativo serve o retrieval, e a troca é instantânea.
O que os times já perguntam a ele.
"Quais destes 400 contratos renovam automaticamente antes de setembro, e qual aviso cada um exige?"
"A apresentação para investidores contradiz as demonstrações auditadas em algum ponto?"
"Como o rate limiting foi implementado, e onde isso está documentado?"
"Quais sinistros deste lote estão sem o laudo médico obrigatório?"
"Extraia toda nota acima do valor do pedido num CSV que eu possa mandar para o financeiro."
"O que os clientes disseram sobre o onboarding no último trimestre?"
Seus documentos não treinam nossos modelos.
Compromissos contratuais de não treinar em toda a cadeia de provedores, isolamento de tenant em cada camada e um Trust Center que declara a postura sem rodeios, inclusive o que ainda não é certificado.
Sem treino no seu conteúdo
Compromissos contratuais de não treinar com todos os provedores de modelo da cadeia, repassados no DPA.
Isolamento de tenant
Isolamento imposto nas camadas de aplicação, banco, storage e token de API, não por convenção.
Retenção que você controla
Retenção documentada por categoria de dado, com mecanismos de exclusão que atendem ao art. 18 da LGPD e aos arts. 15–22 do GDPR.
Residência de dados
Regiões declaradas para cada componente do ambiente de produção, com o regime de transferência explicitado.
SLA de 72h para incidentes
Um processo escrito de resposta a incidentes, com matriz de escalonamento e compromisso de post-mortem.
Status de compliance honesto
Certificações herdadas dos subprocessadores listadas ao lado dos controles compensatórios onde ainda não existe certificação formal.
Lista de subprocessadores, modelo de DPA e detalhes de residência noTrust Center.
Comece pela sua pior pasta.
Traga um documento que hoje exige quarenta páginas de leitura e uma pergunta que ninguém responde rápido. Em trinta minutos você vê o agente rodando nele, e não em uma demo genérica.