Aléssio M. Jr logo Aléssio M. Jr logo alessiojr.com
  • Sobre
  • Blog
  • Projetos
  • Palestras
  • Publicações
  • Disciplinas
    • Gestão e Processo de Software
    • Inteligência Artificial II
    • Estágio Supervisionado

    • AED2
    • CLP
    • Compiladores
    • Técnicas de Programação

    • Visão Geral
  • Inovação
    • Visão Geral
    • Influenzer
    • WOK
    • Ecossistema Vale do Aço
    • Palestras
    • Ideias & TCC
    • Português
    • English

Nesta página

  • Evidencias e execucao
  • Implementacao
  • Pontos positivos
  • Lacunas e evolucao
  • Pontuacao
  • Nota recomendada
  • Nota individual recomendada
    • Evidencias e ressalvas individuais
  • Editar essa página
  • Criar uma issue

Laudo Técnico de Avaliação — TP1

equipe-eliel

Autor

Disciplina de Inteligencia Artificial II

Data de Publicação

22/09/2026

Data de Modificação

22/09/2026

Tipo: Avaliacao tecnica coletiva

Status: Recomendacao tecnica

Nota tecnica: 9.0/10.0

Sintese: Trabalho completo, com artefatos e analise experimental consistentes; a principal ressalva e a divergencia entre a calibracao avaliada e a politica servida pela API.

Evidencias e execucao

  • README, reports/, figures/, model_artifacts/, codigo, dependencias, testes, Docker e historico Git inspecionados.
  • Artefatos presentes: modelo Keras, TF-IDF, lista das 25 classes, MLB, baselines serializados, metricas, historico e seis figuras.
  • PYTHONDONTWRITEBYTECODE=1 python -m pytest -q -p no:cacheprovider: bloqueado na coleta por ModuleNotFoundError: fastapi. E ausencia de dependencia no ambiente, nao defeito demonstrado da entrega.
  • Docker/API nao executados: o unico build de referencia dentro do teto de dois minutos ficou apenas na instalacao de TensorFlow; nao havia imagem compativel local. O Dockerfile e as instrucoes foram inspecionados estaticamente.
  • Git mostra entregas separadas de dados, baseline/rede/calibracao, artefatos autocontidos e integracao posterior da API real por integrantes distintos.

Implementacao

  • Dados: 2.830 exemplos, Top 25, TF-IDF ajustado somente no treino e split 80/10/10. A estratificacao e por dificuldade, nao multi-label.
  • Dois baselines OvR e MLP Keras com sigmoid/BCE, dropout, L2, BatchNorm e early stopping. Os relatorios mostram LinearSVC F1-macro 0.518 e melhor rede 0.494; a conclusao corretamente reconhece que a rede nao supera o baseline macro.
  • A calibracao por classe sobe a rede de 0.321 (tau 0.5) para 0.492, com metricas, F1 por classe e curvas persistidos.
  • API tem contrato, erros 503 e artefatos reais. Contudo, KerasPredictor.predict() ignora os thresholds calibrados e sempre devolve as tres maiores probabilidades. Portanto, a API nao serve a regra avaliada nos relatorios.

Pontos positivos

  • Comparacao experimental honesta: nao mascara que o baseline linear supera a rede em F1-macro.
  • Boa analise do threshold, do desbalanceamento e do semantic gap, sustentada por artefatos JSON e figuras.
  • Boa separacao de camadas, versoes de ML fixadas e validacao explicita do handoff de modelo.

Lacunas e evolucao

  • Corrigir a API para carregar e aplicar os limiares por classe (ou documentar e avaliar formalmente a politica top-3). Hoje existe train/serve skew.
  • Os comandos de reproducao python data.py, python baseline.py e similares nao correspondem aos arquivos sob app/mlops/; devem ser corrigidos ou empacotados como modulos.
  • A estratificacao por dificuldade nao preserva necessariamente cada label; usar split multi-label seria evolucao metodologica.

Pontuacao

Criterio Maximo Pontos Justificativa
Dados e formulacao multi-label 1.5 1.4 Pipeline sem leakage e formulacao correta; split nao e multi-label.
Baseline, rede e resultados 2.5 2.3 Baselines, rede e artefatos completos; rede fica abaixo do melhor baseline macro.
Evolucao e justificativa experimental 2.0 1.7 Calibracao e limites bem analisados, mas nao chegam ao serving.
API e contrato 1.5 1.3 Contrato bom, mas a politica real diverge da avaliacao.
Reproducibilidade e qualidade 1.5 1.3 Artefatos e Docker bons; comandos ML do README estao incorretos e testes nao rodaram no ambiente.
Documentacao e colaboracao 1.0 1.0 README, fontes, papeis e historico consistentes.
Total 10.0 9.0

Nota recomendada

9.0/10.0 Trabalho muito completo e empiricamente honesto. A deducao principal e a divergencia entre a calibracao avaliada e a decisao que a API efetivamente serve.

Nota individual recomendada

A componente de produto coletivo e 4.5/5.0, correspondente a metade da nota tecnica atual (9.0/10.0). A concentracao de commits em um autor nao foi convertida diretamente em nota: foram avaliados os artefatos e MRs associados a cada papel.

Integrante Papel declarado e evidencia observada Produto (5,0) Papel (3,0) Rastreab. (1,5) Colab./qual. (0,5) Final / 10
Eliel Vitor Almeida Dados/artefatos/testes/relatorio: pipeline TF-IDF, splits, testes CI-safe, artefatos e documentacao no MR !3. 4.5 3.0 1.5 0.4 9.4
Gabriel Silva ML: baseline OvR, rede multi-label, avaliacao e calibracao, em entrega tecnica identificavel no historico. 4.5 3.0 1.3 0.3 9.1
Felipe Cassemiro API/DevOps: FastAPI, health, compose, CI e integracao dos artefatos reais no MR !4. 4.5 3.0 1.5 0.5 9.5

Evidencias e ressalvas individuais

  • O papel de Gabriel esta delimitado tecnicamente, embora sua entrega principal esteja consolidada em um unico commit; isto limita a granularidade da rastreabilidade, nao a avaliacao de volume.
  • Eliel e Felipe possuem MRs e historico que mostram preparacao/integração de componentes distintos. Nao ha Issues para demonstrar planejamento ou revisoes formais.
  • O train/serve skew dos thresholds e um defeito coletivo da entrega; ele ja reduz a parcela de produto e deve ser discutido por todos na arguicao.

As notas dependem da confirmacao oral de autoria e compreensao tecnica.

De volta ao topo

Powered by Quarto.

© Aléssio M. Jr.

  • Editar essa página
  • Criar uma issue

License: CC BY NC SA 4.0.