Plano de Avaliacao do TP1 - 2026/2

Data de Publicação

22/09/2026

Data de Modificação

22/09/2026

Objetivo

Avaliar cada equipe pelo classificador multi-label de skills do WOKDEX e por sua evolucao de engenharia. A avaliacao distingue um artefato que apenas produz uma previsao de um sistema que documenta dados, compara hipoteses, reconhece limites e pode ser reproduzido.

Procedimento

  1. Inspecionar README, historico/relatorio GitLab, estrutura do projeto, dependencias e artefatos gerados.
  2. Executar a suite de testes, o comando documentado de inicializacao e, quando viavel, a API/Docker.
  3. Verificar formulacao multi-label, baseline, modelo neural, metricas, calibracao de limiar, analise de erros e contrato da API.
  4. Registrar comandos, resultados, bloqueios de ambiente, pontos positivos, falhas e proxima evolucao recomendada.

Rubrica de equipe (10 pontos)

Criterio Pontos Evidencia esperada
Dados e formulacao multi-label 1,5 Dataset rastreavel, 25 skills, split sem vazamento, sigmoid/BCE ou justificativa equivalente.
Baseline, rede e resultados 2,5 Baseline comparado a rede, metricas macro/micro, artefatos e resultados reproduziveis.
Evolucao e justificativa experimental 2,0 Decisoes explicadas, threshold, desbalanceamento, analise de erros e limites reconhecidos.
API e contrato 1,5 GET /health, POST /predict, schema valido, respostas e erros previsiveis.
Reproducibilidade e qualidade 1,5 Testes, dependencias, Docker/compose ou instrucoes executaveis, CI quando disponivel.
Documentacao e colaboracao 1,0 README/artigo SBC incremental, fontes, papeis, historico e evidencias de evolucao.

Principios de julgamento

  • F1 e latencia sao evidencias, nao a unica medida de qualidade.
  • Ausencia de TensorFlow, Docker ou dados no ambiente de avaliacao nao e falha automatica; o bloqueio e registrado e a reproducibilidade documentada e avaliada.
  • Resultados sem baseline, sem split claro ou sem analise critica recebem menos credito mesmo quando exibem metricas altas.
  • Codigo incompleto pode receber credito pela evolucao verificavel, mas nao pelo requisito final que ainda nao atende.
  • A nota e uma recomendacao de equipe; autoria individual exige evidencia complementar de commits, code review e arguicao.
De volta ao topo