TP3 Master: Auditoria de Evidências, Abstenção e Reprodutibilidade

Trilha IC 2026-2 - auditoria experimental do pipeline TP1-TP2-TP3

Entrega de pesquisa opcional para equipes IC explicitamente aceitas, baseada nos artefatos de retrieval do TP2 e RAG do TP3.
Data de Publicação

05/10/2026

Data de Modificação

29/09/2026

Natureza e elegibilidade

Esta é uma alternativa de pesquisa ao TP3 regular, destinada somente a equipes da Trilha IC explicitamente aceitas pelo professor. Para essas equipes, o TP3 Master substitui o TP3 regular, vale os mesmos 20 pontos e mantém as apresentações em 30/11 e 02/12. Equipes não aceitas na Trilha IC devem realizar integralmente o TP3 regular.

O TP3 Master não cria uma obrigação extra e não acumula duas notas de TP3. A aceitação será confirmada pelo professor após o TP1, com confirmação do escopo e da equipe antes do início do TP3. Caso uma equipe IC não seja formalmente aceita para esta substituição, permanece no TP3 regular.

ImportanteEscopo revisado de 2026-2

O TP3 regular não exige agentes, LangChain, LangGraph, tool calling, geração de YAML ou qualquer sistema multiagente. Este TP3 Master também não usa YAMLs ou agentes como fonte de dados. Seus objetos de estudo são os artefatos reais do TP2 (índice, contrato de embedding, splits.json, Golden Set, resultados e proveniência) e do TP3 (contratos, evidências recuperadas, citações, decisões de abstinção, logs e seis casos avaliados).

Agentes pertencem exclusivamente à TP3.5, trilha opcional e experimental. Se uma equipe a explorar, seus resultados devem ficar separados e não podem ser a fonte dos dados nem condição para a auditoria.

Pergunta de pesquisa

RQ: Em casos de avaliação previamente definidos ou coletados sob protocolo, as respostas RAG do TP3 apresentam evidência rastreável, citações válidas, abstinção apropriada e resultados reproduzíveis a partir dos artefatos do TP2?

O objetivo não é provar que uma estratégia é sempre melhor. A equipe deve identificar evidências suficientes, falhas de suporte, decisões de abstinção adequadas ou inadequadas e lacunas que impeçam a reprodução. Resultado negativo ou inconclusivo é válido quando o protocolo, os dados e as limitações estiverem claros.

Dados, contratos e cuidados éticos

Usem apenas artefatos versionados da própria equipe, fornecidos voluntariamente por equipes participantes ou disponibilizados pelo professor. Não coletem dados pessoais, conversas privadas, chaves, tokens ou raciocínio interno de LLM. Casos coletados devem ser anonimizados e registrados com origem, data, licença/permissão e finalidade.

O conjunto auditado deve preservar o vínculo entre:

  • o manifesto e SHA-256 do corpus, o splits.json e o embedding-contract.json do TP2;
  • a consulta, o resultado de retrieval e os supporting_ids/trechos que sustentam a recomendação;
  • o contrato TP1/TP2, a resposta RAG, as citações e a decisão RESPONDER, ABSTER ou PEDIR_ESCLARECIMENTO do TP3;
  • versão de código, ambiente, semente, comando de execução, data e resultados produzidos.

Não alterem rótulos, citações, logs ou resultados após a auditoria sem criar nova execução identificada. Dados brutos eventualmente sensíveis ficam fora do repositório público; publiquem somente versões anonimizadas, agregadas ou instruções de acesso autorizadas.

Método fixo

O método abaixo é obrigatório para tornar os resultados comparáveis e viáveis no tempo disponível.

  1. Congelamento e inventário. Até 19/10, registrem versões, hashes, responsáveis, comandos e disponibilidade dos artefatos TP2 já produzidos. A falta de um artefato é um achado de reprodutibilidade, não algo a ser preenchido retroativamente sem registro.
  2. Casos auditáveis. Definam antes da rodada final pelo menos 12 casos: os seis tipos obrigatórios do TP3 (direto, estratégia distinta, paráfrase, ambíguo, fora do domínio e falha controlada) mais seis casos derivados do Golden Set ou de discordâncias do TP2. Cada caso deve conter entrada, expectativa, critério de julgamento, origem e revisor que não o implementou.
  3. Auditoria de evidência e citação. Para cada caso, verifiquem se cada afirmação relevante está apoiada por item retornado na mesma requisição, se a citação aponta para o ID/título correto e se a evidência foi recuperada do índice de treino conforme o contrato TP2. Classifiquem como suportada, parcial, não suportada ou não verificável.
  4. Auditoria de abstinção. Apliquem a política documentada do TP3 aos casos ambíguos, fora do domínio, sem recuperação e com falha controlada. Julguem se a decisão e a mensagem evitam inventar fonte, skill ou recomendação. Registrem falsos RESPONDER e abstinções excessivas.
  5. Reprodução independente. Uma pessoa diferente da autora principal executa os comandos em ambiente limpo ou perfil separado, usando as versões congeladas. Comparem decisões, citações, IDs recuperados e métricas; expliquem qualquer divergência.
  6. Síntese. Produzam tabelas de cobertura de evidência, validade de citações, adequação de abstinção e sucesso de reprodução, além de uma análise qualitativa de pelo menos quatro falhas ou limitações.

Não é exigido teste estatístico. Se a equipe usar intervalos de confiança ou outro método adicional, deve justificá-lo e manter o protocolo principal intacto.

Até 16/11/2026, registrem um alerta técnico de risco não avaliativo: contratos e mocks verificados, um caso fundamentado e um caso de abstenção executados, e um risco com responsável. O marco não cria aula adicional nem substitui a entrega final.

Entregáveis

O repositório da equipe deve conter:

  • audit/protocol.md com pergunta, método fixo, critérios de julgamento, papéis e ameaças à validade;
  • audit/artifact-inventory.csv ou equivalente com origem, versão/hash, licença/permissão, responsável e comando de reprodução de cada artefato TP2/TP3;
  • audit/cases.yaml com os 12 ou mais casos, expectativas congeladas, origem e revisão cruzada;
  • decisão documentada de PII, retenção e provedor para os dados e serviços usados na auditoria ou herdados do TP3;
  • registros de auditoria por caso, incluindo consulta, evidências, resposta, citações, decisão, julgamento e justificativa;
  • scripts/comandos para gerar as tabelas e repetir a auditoria, com ambiente, dependências e sementes documentados;
  • resultado da reprodução independente e relatório de divergências;
  • artigo/ ou docs/artigo/ com o artigo curto no formato SBC;
  • README.md com instruções de execução, autoria, limitações, dados que não podem ser publicados e localização dos artefatos.

É aceitável usar mocks compatíveis quando um serviço estiver indisponível, desde que o caso seja marcado como tal. Mocks não contam como reprodução da execução real e não podem substituir silenciosamente os resultados reais.

Papéis para quatro estudantes

Cada estudante assume aproximadamente 15 horas, faz revisão de uma entrega de colega e mantém commits/MRs identificáveis.

Papel Responsabilidade principal Evidência individual
Pessoa A - Protocolo e dados Inventário, proveniência, anonimização, congelamento e cases.yaml Protocolo, hashes, permissões e casos revisados
Pessoa B - Evidência e citações Auditoria de retrieval, trechos, supporting_ids e correspondência das citações Planilhas/registros de cobertura e testes de validação
Pessoa C - Abstenção e integração Auditoria das decisões, falhas de contrato e mensagens degradadas Casos de abstinção, logs e análise de decisões
Pessoa D - Reprodução e artigo Ambiente limpo, scripts, comparação de execuções, tabelas e redação SBC Relatório de reprodução, tabelas geradas e seção do artigo

Artigo curto SBC (3-4 páginas)

Entreguem um artigo de 3 a 4 páginas, sem contar referências e apêndices quando o modelo SBC os separar. O texto deve ser baseado nos casos predefinidos/coletados e nos registros reais da auditoria, não em resultados ilustrativos.

Estrutura mínima:

  1. Problema e pergunta de pesquisa.
  2. Artefatos TP2/TP3, contratos e proveniência dos dados.
  3. Método: casos, critérios para evidência/citação, política de abstinção e reprodução independente.
  4. Resultados: tabelas de cobertura de evidência, validade de citações, abstinção e reprodução.
  5. Discussão: falhas, limitações, ameaças à validade e próximo passo justificável.

Incluam pelo menos uma tabela de casos, uma tabela de resultados e as citações acadêmicas efetivamente usadas. A seção de método deve permitir que outra equipe refaça a auditoria sem depender de conhecimento oral.

Cronograma

Período Marco Evidência
Até 19/10 Fechamento do TP2 e preparação IC Inventário inicial, papéis, protocolo e casos candidatos do Golden Set/discordâncias
20/10-31/10 Congelamento de artefatos Hashes, contratos TP2, comandos e casos auditáveis definidos antes da rodada final
01/11-10/11 Integração TP3 e piloto Registros de evidência/citação, política de abstinção e dois casos piloto revisados
11/11-17/11 Auditoria principal Doze ou mais casos executados, julgamentos cruzados e falhas registradas
18/11-25/11 Reprodução e síntese Execução independente, comparação, tabelas e artigo SBC revisado
26/11 Entrega do TP3 Master Repositório, auditoria e artigo SBC de 3-4 páginas
30/11 e 02/12 Apresentações Demonstração dos achados, defesa do método e limitações

Apresentações em 30/11 e 02/12

Apresentem em até 6 minutos, com participação de todos:

  1. Pergunta, artefatos e protocolo (1 minuto).
  2. Um caso com resposta fundamentada e citações verificadas (1 minuto).
  3. Um caso de abstinção ou falha degradada (1 minuto).
  4. Resultados da auditoria e da reprodução independente (2 minutos).
  5. Limitação relevante e recomendação concreta para o TP3 (1 minuto).

Preparem captura de tela ou vídeo curto como contingência, sem substituir os registros e scripts versionados.

Rubrica (20 pontos)

Critério Pontos Evidência
Protocolo, casos e governança de dados 3,0 Método fixo, 12+ casos, origem, revisão cruzada e tratamento de dados
Auditoria de evidências e citações 4,0 Registros por caso, rastreabilidade TP2 e classificação justificada
Auditoria de abstinção e falhas seguras 3,0 Casos ambíguos, fora do domínio e falha controlada, sem fonte inventada
Reprodutibilidade e engenharia 3,0 Inventário, hashes, scripts, ambiente e execução independente
Análise crítica e resultados 2,5 Tabelas, divergências, quatro ou mais falhas/limitações e conclusões proporcionais
Artigo curto SBC 2,5 3-4 páginas, método, casos, contratos, citações e resultados reais
Apresentação e defesa técnica 1,0 Clareza, participação e limites explicitados
Contribuição individual comprovável 1,0 Papel, commits/MRs e revisão de colega
Total 20,0

Checklist de entrega em 26/11

De volta ao topo