Machine learning na predição de diabetes: uma abordagem explicável
| dc.contributor.advisor | Lima, Náthalee Cavalcanti de Almeida | |
| dc.contributor.advisormail | nathalee.lima@ufersa.edu.br | |
| dc.contributor.author | Costa, Débora Fernandes | |
| dc.contributor.referee1 | Lima, Náthalee Cavalcanti de Almeida | |
| dc.contributor.referee2 | Vieira, George Felipe Fernandes | |
| dc.contributor.referee3 | Sousa, Reudismam Rolim de | |
| dc.coverage.spatial | Pau dos Ferros | |
| dc.date.accessioned | 2026-07-14T16:44:28Z | |
| dc.date.available | 2026-07-14T16:44:28Z | |
| dc.date.issued | 2026-06-17 | |
| dc.description.abstract | O Diabetes Mellitus é uma doença crônica que representa um importante problema de saúde pública, estando associado a diversas complicações que impactam significativamente a qualidade de vida dos indivíduos. Nesse contexto, técnicas de Machine Learning têm sido amplamente utilizadas para apoiar a predição e o diagnóstico precoce da doença. Entretanto, apesar do bom desempenho apresentado por muitos modelos, a falta de transparência em suas decisões ainda representa um desafio para sua aplicação em ambientes clínicos. Diante disso, este trabalho teve como objetivo desenvolver e avaliar modelos de ML para a predição de diabetes, analisando seu desempenho e explorando a explicabilidade do modelo com melhor resultado por meio da técnica SHAP. Para isso, foi utilizado o conjunto de dados Diabetes Prediction Dataset, disponível na plataforma Kaggle, contendo aproximadamente 100 mil registros e nove variáveis clínicas e demográficas. O pré-processamento dos dados envolveu codificação de variáveis categóricas, padronização dos atributos e seleção de características utilizando o método RFE. Foram implementados os algoritmos Regressão Logística, KNN, SVC, Random Forest e MLP. Os modelos foram submetidos à otimização de hiperparâmetros por meio da técnica Grid Search e avaliados utilizando validação cruzada em 10-Fold, considerando as métricas acurácia, precisão, recall, F1-score e AUC-ROC. Os resultados mostraram que os modelos apresentaram desempenho superior na identificação da classe majoritária, enquanto a classe referente aos pacientes diabéticos apresentou maior dificuldade de classificação, evidenciando os impactos do desbalanceamento dos dados. Entre os modelos avaliados, o MLP apresentou o melhor desempenho geral, enquanto o SVC apresentou melhoria significativa após a otimização dos hiperparâmetros. A aplicação da técnica SHAP permitiu identificar as variáveis mais relevantes para as predições, destacando principalmente o nível de glicose no sangue, a hemoglobina glicada, a idade e o índice de massa corporal. Os resultados obtidos demonstram que algoritmos clássicos de ML, aliados a técnicas de explicabilidade, podem contribuir para a construção de modelos confiáveis e transparentes, com potencial para apoiar a tomada de decisão clínica e a detecção precoce do diabetes. | |
| dc.description.abstract2 | Diabetes Mellitus is a chronic disease that represents a major public health challenge and is associated with several complications that significantly affect patients' quality of life. In this context, Machine Learning techniques have been widely applied to support diabetes prediction and early diagnosis. However, despite their predictive performance, the lack of transparency in model decisions remains a challenge for their adoption in clinical settings. Therefore, this study aimed to develop and evaluate machine learning models for diabetes prediction, analyzing their performance and exploring the explainability of the best-performing model using the SHAP technique. The Diabetes Prediction Dataset, available on Kaggle, was used in this research, containing approximately 100,000 records and nine clinical and demographic variables. Data preprocessing included categorical variable encoding, feature scaling, and feature selection through the RFE method. The implemented algorithms were Logistic Regression, K-Nearest Neighbors, Support Vector Machine, Random Forest, and Multilayer Perceptron. The models were optimized using the Grid Search technique and evaluated through stratified 10-Fold cross-validation using accuracy, precision, recall, F1-score, and AUC-ROC metrics. The results showed that the models achieved better performance in identifying the majority class, while the diabetic class was more difficult to classify, highlighting the impact of class imbalance. Among the evaluated models, the MLP achieved the best overall performance, whereas the SVM showed a significant improvement after hyperparameter optimization. The application of SHAP enabled the identification of the most influential variables in the predictions, with blood glucose level, glycated hemoglobin, age, and body mass index emerging as the most relevant features. The findings demonstrate that classical machine learning algorithms combined with explainability techniques can contribute to the development of reliable and transparent models, with potential to support clinical decision-making and early diabetes detection. | |
| dc.description.physical | 56 f. | |
| dc.description.sponsorship | Programa de Iniciação Científica Institucional -PICI | |
| dc.format.mimetype | ||
| dc.identifier.bibliographicCitation | COSTA, Débora Fernandes. Machine learning na predição de diabetes: uma abordagem explicável. 56 f. 2026. Monografia (Bacharelado Interdisciplinar em Tecnologia da Informação) – Centro Multidisciplinar de Pau dos Ferros, Universidade Federal Rural do Semi-Árido, Pau dos Ferros, 2026. | |
| dc.identifier.uri | https://repositorio.ufersa.edu.br/handle/prefix/15394 | |
| dc.language.iso | pt_BR | |
| dc.publisher.center | Centro Multidisciplinar de Pau dos Ferros - CMPF | |
| dc.publisher.country | Brasil | |
| dc.publisher.department | Departamento de Engenharias e Tecnologia - DETEC | |
| dc.publisher.initials | UFERSA | |
| dc.publisher.institution | Universidade Federal Rural do Semi-Árido | |
| dc.rights | info:eu-repo/semantics/openAccess | |
| dc.rights.holder | UFERSA | |
| dc.rights.license | Attribution-ShareAlike 3.0 Brazil | en |
| dc.rights.uri | http://creativecommons.org/licenses/by-sa/3.0/br/ | |
| dc.subject.cnpq | CIENCIAS EXATAS E DA TERRA::TECNOLOGIA DA INFORMACAO | |
| dc.subject.keyword | Diabetes | |
| dc.subject.keyword | Machine learning | |
| dc.subject.keyword | Predição | |
| dc.subject.keyword | Explicabilidade | |
| dc.subject.keyword | SHAP | |
| dc.subject.keyword | Diabetes | |
| dc.subject.keyword | Prediction | |
| dc.subject.keyword | Explainability | |
| dc.subject.keyword | SHAP | |
| dc.title | Machine learning na predição de diabetes: uma abordagem explicável | |
| dc.title.alternative | Machine learning for diabetes prediction: an explainable approach | |
| dc.type | info:eu-repo/semantics/bachelorThesis |
