PROGRAMA DE PÓS-GRADUAÇÃO EM INFORMÁTICA (PPGI)
UNIVERSIDADE FEDERAL DA PARAÍBA
- Telefone/Ramal
-
Não informado
Notícias
Banca de QUALIFICAÇÃO: THIAGO ALEXANDRE AGUSTINHO DOS SANTOS
Uma banca de QUALIFICAÇÃO de MESTRADO foi cadastrada pelo programa.
DISCENTE: THIAGO ALEXANDRE AGUSTINHO DOS SANTOS
DATA: 28/08/2026
HORA: 14:00
LOCAL: Centro de Informática
TÍTULO: Correção Automatizada de Redações com Modelos de Linguagem de Baixo Custo: Avaliação por Competência, Impacto do OCR e Proposta de Arquitetura Multiagente
PALAVRAS-CHAVES: correção automatizada de redações; ENEM; modelos de linguagem;
OCR;sistemasmultiagentes;avaliaçãoeducacional.
PÁGINAS: 60
RESUMO: O avanço da inteligência artificial e dos Modelos de Linguagem de Grande Escala (Large
LanguageModelsLLMs)ampliouoempregodessastecnologiasnaavaliaçãotextual. Esta
pesquisa investiga o desempenho de LLMs de baixo custo na correção automatizada de redações
conformeascincocompetênciasdoExameNacionaldoEnsinoMédio(ENEM),utilizandonotas
de avaliadores humanos como referência e examinando o impacto do Reconhecimento Óptico de
Caracteres(OCR)emtextosmanuscritos. Adota-seumaabordagemquantitativaexploratória,
complementada por análise qualitativa de erros, vieses e divergências. O estudo abrange três
frentes: comparação de modelos na correção de redações transcritas manualmente; avaliação
da influência do OCR sobre a transcrição e a pontuação; e desenvolvimento do AutoRedAI,
arquiteturamultiagentecomorquestraçãocentralizadaearbitragemdediscrepâncias,inspiradana
duplacorreçãodoENEM.ForamavaliadosGemini2.5FlashLite,DeepSeek-chat,GPT-4o-mini,
GPT-5 mini e GPT-4.1 por meio de MAE, RMSE, viés, correlações de Pearson e Spearman,
ICC e Quadratic Weighted Kappa (QWK). No primeiro experimento, com 50 redações e um
prompt inicial, observou-se alinhamento parcial com os avaliadores humanos e diferenças entre
competências. Nosegundo,com52redaçõesoficiaisdoENEMeumpromptmaisrobusto,as
notas se aproximaram das avaliações humanas, destacando-se Gemini 2.5 Flash Lite e GPT-4.1.
Contudo,comocorpusepromptmudaramsimultaneamente,amelhoranãopodeseratribuída
apenasaoprompt. NoestudodeOCR,oGemini2.5FlashLiteapresentouosmenoresvalores
médiosdeCEReWER,indicandomaiorfidelidadenaconversãodosmanuscritos. Combase
nesses resultados, implementou-se uma versão preliminar do AutoRedAI, arquitetura híbrida
e modular que separa OCR e correção. Gemini 2.5 Flash Lite e DeepSeek-chat produzem
duas avaliações iniciais; ao detectar discrepância, o orquestrador solicita uma terceira avaliação
independenteao GPT-4.1eselecionaosdoispareceresmaispróximosparaconsolidaranotae
gerarfeedbackporcompetência. Nostestespreliminares,osistemaalcançouPearsonde0,83,
Spearmande0,88eQWKde0,69paraanotafinal,indicandoassociaçãopositivaeconcordância
moderada. Entretanto,apresentousubestimação,comviésmédiode-117,50pontoseMAEde
137,50, demonstrando a necessidade de calibração, ampliação da amostra e análise dos casos
divergentes. Osresultados sugeremque LLMsdebaixo custopodem apoiara correçãoquando
combinadoscomvalidaçãoestatística,controledediscrepâncias,avaliaçãoporcompetênciae
revisão humana. A arquitetura proposta fornece evidências iniciais da viabilidade de um sistema
multiagente centralizado, escalável e auditável, conciliando custo, robustez avaliativa e feedback
pedagógicoestruturado.
MEMBROS DA BANCA:
Presidente(a) - 2579537 - ALISSON VASCONCELOS DE BRITO
Interno(a) - 1175878 - LUCIDIO DOS ANJOS FORMIGA CABRAL
Externo(a) ao Programa - 1559497 - MOISES DANTAS DOS SANTOS