EM POUCAS LINHAS
- Um fato presente nas saídas de ferramentas pode ser atribuído à fonte errada na resposta.
- A verificação por afirmação compara o suporte encontrado com a fonte indicada pelo agente.
- O teste com fontes semelhantes expõe um limite importante para identificar a origem exata.
- Procedência e consistência entre execuções exigem avaliações diferentes.
Um agente pode consultar várias ferramentas, encontrar um dado verdadeiro e ainda responder de modo enganoso ao dizer de onde ele veio. O artigo da equipe do ProvenanceGuard, publicado em 29 de setembro de 2026, apresenta uma forma de verificar esse problema em respostas produzidas com saídas de ferramentas MCP. Essa é a data do artigo de divulgação; a fonte não estabelece uma data separada para o estudo técnico. A pergunta prática não é apenas se o fato aparece em algum lugar do material consultado, mas se a saída atribuída a cada afirmação realmente a sustenta.
O fato está correto, mas veio de onde?
Os autores chamam de confusão entre fontes o caso em que uma afirmação é verdadeira em alguma evidência disponível, porém a resposta a atribui a outra fonte. Se todas as saídas forem reunidas antes da checagem, um verificador poderá encontrar o fato e aprovar a frase sem perceber o erro de procedência, explica o artigo dos pesquisadores.
Imagine um exemplo hipotético: um agente consulta o cadastro de uma pessoa e um documento de políticas. A política prevê uma condição de reembolso, mas a resposta diz que ela consta no cadastro. A condição pode estar correta; a declaração sobre o cadastro, não. A distinção importa porque uma regra geral e um registro individual respondem a perguntas diferentes. Em vez de perguntar somente «há evidência para esta frase?», a avaliação precisa perguntar «a fonte que a resposta indica contém evidência para esta frase?».
Como conferir cada afirmação
Segundo a descrição do ProvenanceGuard, a verificação acontece depois que o agente gera a resposta e usa um registro das chamadas MCP que conserva as saídas das ferramentas e seus identificadores de fonte; não exige retreinar o agente. O sistema separa a resposta em afirmações, procura a fonte mais relevante para cada uma, verifica se ela sustenta a afirmação e compara essa fonte com a que a resposta nomeia ou sugere. Ao fim, produz uma decisão por afirmação e uma decisão de liberar ou bloquear a resposta.
Isso transforma uma checagem genérica em uma trilha examinável: para cada afirmação, é possível inspecionar o que foi dito, qual saída foi considerada, se havia suporte e se a atribuição coincidia. Não basta guardar a resposta final. Sem o registro das saídas e dos IDs, falta a ligação necessária para refazer essa comparação. Também é preciso ler com cuidado uma referência implícita: dizer «segundo o cadastro» é diferente de apenas apresentar um fato sem indicar sua origem.
Os autores relatam que a configuração avaliada utilizou modelos locais para selecionar fontes, verificar suporte e decompor respostas. Eles observam que uma adaptação a modelos hospedados exigiria testes e calibração próprios; os resultados publicados não medem essa configuração alternativa, conforme o relato da equipe.
O que os resultados permitem concluir
Na avaliação relatada pelos autores, foram estudados 281 registros de execução de um agente médico; no teste principal, especialistas examinaram 361 afirmações de 40 respostas reservadas para avaliação. Dessas afirmações, os especialistas consideraram que 139 não deveriam ser aprovadas: o sistema bloqueou 138 e deixou passar uma. Também reteve 67 afirmações que os especialistas consideraram sustentadas, encaminhando-as para revisão ou reparo. Portanto, detectar quase todas as afirmações que não deveriam passar nesse conjunto veio acompanhado de bloqueios de afirmações sustentadas.
O acerto da fonte exata é uma questão diferente da decisão de bloquear. Em um teste separado, mais difícil, com fontes semelhantes, o artigo relata F1 de 0,846 para decidir quais afirmações bloquear, mas identificação correta da fonte exata em 50,3% das afirmações. Já numa troca controlada da fonte nomeada em 50 casos, mantendo a evidência de suporte, o sistema detectou todas as trocas. O êxito nesse cenário controlado não apaga a dificuldade de distinguir várias origens plausíveis. Nenhum desses resultados demonstra desempenho geral para todo agente MCP ou para aplicações brasileiras.
Procedência não é repetibilidade
Outra dimensão da confiabilidade é saber se o agente consegue repetir o sucesso na mesma tarefa. Em pesquisa distinta divulgada pela IBM Research, um agente ReAct com GPT-4.1 no AppWorld teve sucesso em 77,4% das execuções, em média, ao longo de cinco repetições, mas concluiu todas as cinco execuções em apenas 53,0% das tarefas. Esse experimento mede consistência entre execuções, não se cada afirmação aponta para a saída correta de uma ferramenta.
As duas perguntas são complementares, não intercambiáveis: um agente pode repetir uma atribuição errada, ou acertar a atribuição numa execução e falhar em outra. Quem compara avaliações de agentes pode consultar também a análise do acervo sobre o contexto por trás das notas de benchmarks. Uma nota de sucesso na tarefa não substitui o exame da procedência do texto produzido.
O que uma equipe pode verificar
Para uma equipe no Brasil que avalie um agente com múltiplas ferramentas, o procedimento sugerido pelas evidências é preservar, no ambiente de avaliação, a associação entre cada chamada, sua saída e seu ID de fonte. Depois, vale selecionar respostas para revisão por afirmação: conferir o trecho original da saída, verificar se ele sustenta o enunciado e confrontar sua identidade com a referência feita na resposta. Quando a origem não puder ser determinada com segurança, uma decisão de bloquear ou encaminhar para revisão é mais informativa do que tratar suporte encontrado em outra saída como prova de atribuição correta.
Essa é uma orientação de avaliação, não um relato de teste ou adoção no país. Os resultados do ProvenanceGuard vêm dos conjuntos e da configuração descritos pelos autores; em especial, o teste com fontes semelhantes recomenda cautela antes de confiar automaticamente na identificação da origem. Para situar esse tipo de limite ao lado de outras formas de medir agentes, veja também como interpretar benchmarks de IA.
Fontes e referências
- Getting the Source Right, Not Just the Fact: Source-Aware Verification for MCP AgentsHugging Face Blog · Consultado em 29/09/2026
- Your Agent Aced the Task. Will It Do It Again?Hugging Face Blog · Consultado em 29/09/2026