Laudo Técnico de Avaliação — TP1
equipe-eliel
Tipo: Avaliacao tecnica coletiva
Status: Recomendacao tecnica
Nota tecnica: 9.0/10.0
Sintese: Trabalho completo, com artefatos e analise experimental consistentes; a principal ressalva e a divergencia entre a calibracao avaliada e a politica servida pela API.
Evidencias e execucao
- README,
reports/,figures/,model_artifacts/, codigo, dependencias, testes, Docker e historico Git inspecionados. - Artefatos presentes: modelo Keras, TF-IDF, lista das 25 classes, MLB, baselines serializados, metricas, historico e seis figuras.
PYTHONDONTWRITEBYTECODE=1 python -m pytest -q -p no:cacheprovider: bloqueado na coleta porModuleNotFoundError: fastapi. E ausencia de dependencia no ambiente, nao defeito demonstrado da entrega.- Docker/API nao executados: o unico build de referencia dentro do teto de dois minutos ficou apenas na instalacao de TensorFlow; nao havia imagem compativel local. O Dockerfile e as instrucoes foram inspecionados estaticamente.
- Git mostra entregas separadas de dados, baseline/rede/calibracao, artefatos autocontidos e integracao posterior da API real por integrantes distintos.
Implementacao
- Dados: 2.830 exemplos, Top 25, TF-IDF ajustado somente no treino e split 80/10/10. A estratificacao e por dificuldade, nao multi-label.
- Dois baselines OvR e MLP Keras com sigmoid/BCE, dropout, L2, BatchNorm e early stopping. Os relatorios mostram LinearSVC F1-macro 0.518 e melhor rede 0.494; a conclusao corretamente reconhece que a rede nao supera o baseline macro.
- A calibracao por classe sobe a rede de 0.321 (tau 0.5) para 0.492, com metricas, F1 por classe e curvas persistidos.
- API tem contrato, erros 503 e artefatos reais. Contudo,
KerasPredictor.predict()ignora os thresholds calibrados e sempre devolve as tres maiores probabilidades. Portanto, a API nao serve a regra avaliada nos relatorios.
Pontos positivos
- Comparacao experimental honesta: nao mascara que o baseline linear supera a rede em F1-macro.
- Boa analise do threshold, do desbalanceamento e do semantic gap, sustentada por artefatos JSON e figuras.
- Boa separacao de camadas, versoes de ML fixadas e validacao explicita do handoff de modelo.
Lacunas e evolucao
- Corrigir a API para carregar e aplicar os limiares por classe (ou documentar e avaliar formalmente a politica top-3). Hoje existe train/serve skew.
- Os comandos de reproducao
python data.py,python baseline.pye similares nao correspondem aos arquivos sobapp/mlops/; devem ser corrigidos ou empacotados como modulos. - A estratificacao por dificuldade nao preserva necessariamente cada label; usar split multi-label seria evolucao metodologica.
Pontuacao
| Criterio | Maximo | Pontos | Justificativa |
|---|---|---|---|
| Dados e formulacao multi-label | 1.5 | 1.4 | Pipeline sem leakage e formulacao correta; split nao e multi-label. |
| Baseline, rede e resultados | 2.5 | 2.3 | Baselines, rede e artefatos completos; rede fica abaixo do melhor baseline macro. |
| Evolucao e justificativa experimental | 2.0 | 1.7 | Calibracao e limites bem analisados, mas nao chegam ao serving. |
| API e contrato | 1.5 | 1.3 | Contrato bom, mas a politica real diverge da avaliacao. |
| Reproducibilidade e qualidade | 1.5 | 1.3 | Artefatos e Docker bons; comandos ML do README estao incorretos e testes nao rodaram no ambiente. |
| Documentacao e colaboracao | 1.0 | 1.0 | README, fontes, papeis e historico consistentes. |
| Total | 10.0 | 9.0 |
Nota recomendada
9.0/10.0 Trabalho muito completo e empiricamente honesto. A deducao principal e a divergencia entre a calibracao avaliada e a decisao que a API efetivamente serve.
Nota individual recomendada
A componente de produto coletivo e 4.5/5.0, correspondente a metade da nota tecnica atual (9.0/10.0). A concentracao de commits em um autor nao foi convertida diretamente em nota: foram avaliados os artefatos e MRs associados a cada papel.
| Integrante | Papel declarado e evidencia observada | Produto (5,0) | Papel (3,0) | Rastreab. (1,5) | Colab./qual. (0,5) | Final / 10 |
|---|---|---|---|---|---|---|
| Eliel Vitor Almeida | Dados/artefatos/testes/relatorio: pipeline TF-IDF, splits, testes CI-safe, artefatos e documentacao no MR !3. | 4.5 | 3.0 | 1.5 | 0.4 | 9.4 |
| Gabriel Silva | ML: baseline OvR, rede multi-label, avaliacao e calibracao, em entrega tecnica identificavel no historico. | 4.5 | 3.0 | 1.3 | 0.3 | 9.1 |
| Felipe Cassemiro | API/DevOps: FastAPI, health, compose, CI e integracao dos artefatos reais no MR !4. | 4.5 | 3.0 | 1.5 | 0.5 | 9.5 |
Evidencias e ressalvas individuais
- O papel de Gabriel esta delimitado tecnicamente, embora sua entrega principal esteja consolidada em um unico commit; isto limita a granularidade da rastreabilidade, nao a avaliacao de volume.
- Eliel e Felipe possuem MRs e historico que mostram preparacao/integração de componentes distintos. Nao ha Issues para demonstrar planejamento ou revisoes formais.
- O train/serve skew dos thresholds e um defeito coletivo da entrega; ele ja reduz a parcela de produto e deve ser discutido por todos na arguicao.
As notas dependem da confirmacao oral de autoria e compreensao tecnica.