Laudo Técnico de Avaliação — TP1
equipe-jp030505
Tipo: Avaliacao tecnica coletiva
Status: Recomendacao tecnica
Nota tecnica: 9.9/10.0
Sintese: Entrega completa e coerente entre experimento e serving, com evolucao experimental rastreavel; o pinning de TensorFlow e a validacao externa seguem como ressalvas.
Evidencias e execucao
- README, relatorio de otimizacao, JSON de metricas, modelos, figuras, codigo, dependencias, testes, Docker e historico Git inspecionados.
models/contem modelo Keras, vetor TF-IDF e MLB;reports/metricas.jsonpreserva dataset, curvas de tau, thresholds por classe e F1 por skill.PYTHONDONTWRITEBYTECODE=1 python -m pytest -q -p no:cacheprovider: falhou na coleta porModuleNotFoundError: fastapi. E bloqueio do ambiente avaliador sem instalacao de pacotes.- Docker/API nao executados: a tentativa de build de referencia com TensorFlow consumiu o teto de dois minutos antes da imagem ficar pronta, e nao havia base compativel local. A avaliacao estatica confirma que o Dockerfile copia codigo, modelos e
reports/metricas.jsonrequeridos pela API. - Git registra pipelines por papel, a substituicao de mock por modelo real, correcao de artefato ausente no Docker e a evolucao do modelo final.
Implementacao
- O pipeline previne leakage ao ajustar TF-IDF somente no treino e documenta split 80/10/10 fixo, Top 25, sigmoid e BCE.
- Baseline LR OvR: F1-macro 0.265; rede final: 0.513 e F1-micro 0.639. O arquivo de metricas confirma valores, tau global 0.45 e thresholds por classe.
- O relatorio de hiperparametros compara cinco rodadas controladas, diagnostica overfitting por gap treino/validacao e justifica Input Dropout, BatchNorm, taxa de aprendizado e paciencia.
- FastAPI carrega o classificador no lifespan e usa os thresholds do relatorio. Ha os seis testes de contrato, Docker e CI.
Pontos positivos
- Melhor evidencia de justificativa experimental entre as cinco: configuracoes, resultados negativos, diagnostico e criterio de selecao sao rastreaveis.
- Serve o artefato real e a politica de decisao calibrada, evitando o train/serve skew observado em outras equipes.
- Documentacao tecnica cobre metricas, matriz, loss, classes minoritarias, semantic gap, latencia e composicao da equipe.
Lacunas e evolucao
- O split e apresentado como estratificado, mas a documentacao deve explicitar a estrategia efetivamente usada para multi-label, pois apenas a seed e proporcao nao bastam para demonstrar preservacao de labels.
- A dependencia TensorFlow permanece em faixa aberta; fixar versao tambem no requisito principal reduziria risco de reproducao.
- A execucao independente de testes e container ficou bloqueada pelas dependencias ausentes e pelo teto de tempo, nao por erro funcional observado.
Pontuacao
| Criterio | Maximo | Pontos | Justificativa |
|---|---|---|---|
| Dados e formulacao multi-label | 1.5 | 1.5 | Pipeline, leakage, Top 25 e formulacao muito bem evidenciados. |
| Baseline, rede e resultados | 2.5 | 2.5 | Artefatos e comparacao completa, com F1-macro 0.513. |
| Evolucao e justificativa experimental | 2.0 | 2.0 | Cinco experimentos controlados e escolhas tecnicas justificadas. |
| API e contrato | 1.5 | 1.5 | Contrato, modelo real e thresholds calibrados integrados. |
| Reproducibilidade e qualidade | 1.5 | 1.4 | Testes, CI, Docker e artefatos; versao TensorFlow aberta e execucao externa nao confirmada. |
| Documentacao e colaboracao | 1.0 | 1.0 | Excelente README, fontes, relatorio e historico por papel. |
| Total | 10.0 | 9.9 |
Nota recomendada
9.9/10.0 Entrega completa, coerente entre experimento e serving, com evolucao experimental excepcionalmente bem demonstrada.
Nota individual recomendada
A componente de produto coletivo e 4.95/5.0, metade da nota tecnica atual (9.9/10.0). Embora o relatorio agregado atribua varias MRs a Gustavo, o historico detalhado separa os commits de dados, ML, API e DevOps; a nota usa essa autoria observada, nao contagem de linhas ou autoria do merge.
| Integrante | Papel declarado e evidencia observada | Produto (5,0) | Papel (3,0) | Rastreab. (1,5) | Colab./qual. (0,5) | Final / 10 |
|---|---|---|---|---|---|---|
| Gustavo Alexandre Silva | Dados/NLP: pipeline, artefatos e relatorio tecnico; tambem ha otimizacao posterior documentada. | 4.95 | 3.0 | 1.5 | 0.4 | 9.9 |
| Joao Pedro Silva Martins | ML: baseline, rede Keras, calibracao, artefatos e atualizacao do modelo otimizado; integrou as MRs. | 4.95 | 3.0 | 1.5 | 0.5 | 10.0 |
| Gabriel Batista de Souza | Backend: contratos, endpoints, integracao do modelo real e docstrings em MRs distintos. | 4.95 | 3.0 | 1.5 | 0.4 | 9.9 |
| Emanuel Carlos de Oliveira Dias | DevOps: Docker/compose, seis testes, CI shell runner e correcao da imagem para os artefatos reais. | 4.95 | 3.0 | 1.5 | 0.4 | 9.9 |
Evidencias e ressalvas individuais
- A autoria de MRs agregada nao coincide sempre com autoria de codigo: os commits detalhados confirmam Gabriel na API, Emanuel em DevOps, Joao no ML e Gustavo nos dados. O merge por Joao nao desloca a autoria da entrega.
- A colaboracao esta evidenciada por integracoes cruzadas do modelo real, ajustes de imagem e merges em
master; nao ha evidencia de revisoes formais ou Issues. - O pinning incompleto de TensorFlow e a validacao externa bloqueada permanecem ressalvas do produto comum.
A nota maxima recomendada para Joao exige arguicao especialmente rigorosa sobre treinamento, calibracao e selecao do modelo.