Plano de Avaliacao do TP1 - 2026/2
Objetivo
Avaliar cada equipe pelo classificador multi-label de skills do WOKDEX e por sua evolucao de engenharia. A avaliacao distingue um artefato que apenas produz uma previsao de um sistema que documenta dados, compara hipoteses, reconhece limites e pode ser reproduzido.
Procedimento
- Inspecionar README, historico/relatorio GitLab, estrutura do projeto, dependencias e artefatos gerados.
- Executar a suite de testes, o comando documentado de inicializacao e, quando viavel, a API/Docker.
- Verificar formulacao multi-label, baseline, modelo neural, metricas, calibracao de limiar, analise de erros e contrato da API.
- Registrar comandos, resultados, bloqueios de ambiente, pontos positivos, falhas e proxima evolucao recomendada.
Rubrica de equipe (10 pontos)
| Criterio | Pontos | Evidencia esperada |
|---|---|---|
| Dados e formulacao multi-label | 1,5 | Dataset rastreavel, 25 skills, split sem vazamento, sigmoid/BCE ou justificativa equivalente. |
| Baseline, rede e resultados | 2,5 | Baseline comparado a rede, metricas macro/micro, artefatos e resultados reproduziveis. |
| Evolucao e justificativa experimental | 2,0 | Decisoes explicadas, threshold, desbalanceamento, analise de erros e limites reconhecidos. |
| API e contrato | 1,5 | GET /health, POST /predict, schema valido, respostas e erros previsiveis. |
| Reproducibilidade e qualidade | 1,5 | Testes, dependencias, Docker/compose ou instrucoes executaveis, CI quando disponivel. |
| Documentacao e colaboracao | 1,0 | README/artigo SBC incremental, fontes, papeis, historico e evidencias de evolucao. |
Principios de julgamento
- F1 e latencia sao evidencias, nao a unica medida de qualidade.
- Ausencia de TensorFlow, Docker ou dados no ambiente de avaliacao nao e falha automatica; o bloqueio e registrado e a reproducibilidade documentada e avaliada.
- Resultados sem baseline, sem split claro ou sem analise critica recebem menos credito mesmo quando exibem metricas altas.
- Codigo incompleto pode receber credito pela evolucao verificavel, mas nao pelo requisito final que ainda nao atende.
- A nota e uma recomendacao de equipe; autoria individual exige evidencia complementar de commits, code review e arguicao.