Optimizing Chronic Kidney Disease Prediction Via Ensemble Learning On Imbalanced Multi-Feature Clinical Data

Authors

  • Emmanuel John Anagu Federal University Wukari, Taraba state, Nigeria
  • Gani Timothy Abe Federal University Wukari, Nigeria
  • Victoria Zevini Sabo Federal University Wukari, Nigeria
  • Sunday Jatau Lamiri Federal University Wukari, Nigeria

DOI:

https://doi.org/10.47709/brilliance.v6i2.8210

Keywords:

chronic kidney disease, ensemble learning, machine learning

Abstract

Chronic Kidney Disease (CKD) remains a critical global health burden, characterized by its asymptomatic progression in early stages and high risk of culminating in end-stage renal disease, yet timely detection remains elusive within conventional diagnostic frameworks. This study addresses this gap by comparatively evaluating four machine learning classifiers Random Forest, K-Nearest Neighbors (KNN), Support Vector Machine (SVM), and Logistic Regression for early CKD prediction using a multi-feature, class-imbalanced clinical dataset. A dataset comprising 1,659 patient records and 54 clinical, demographic, and laboratory features was sourced from the Kaggle repository, preprocessed through feature elimination (reducing features to 40), standardization, and Random Oversampling to correct class imbalance. An 80-20 train-test split was applied prior to model training and hyperparameter tuning. Classification performance was assessed using accuracy, precision, recall, F1-score, and Area Under the Receiver Operating Characteristic Curve (AUC-ROC). Random Forest achieved the highest accuracy of 99.67%, an AUC of 1.00, and near-perfect precision and recall, substantially outperforming KNN (95.26%), SVM (80.00%), and Logistic Regression (78.53%). These findings confirm the superiority of ensemble bagging methods over distance-based and linear classifiers in managing high-dimensional, imbalanced medical datasets. The study contributes to the growing body of evidence supporting machine learning integration into CKD screening pathways, while underscoring the critical role of class-balancing strategies in preventing diagnostic bias. The deployed Streamlit application further demonstrates a viable pathway toward accessible clinical decision-support tools for CKD early detection.

References

Chen, H., Li, Y., & Zhao, Q. (2022). Real-time chronic kidney disease risk assessment with wearable sensors: A machine learning approach. IEEE Access, 10, 18394–18404.

Chen, J., & Lu, Y. (2018). Data mining applications in healthcare: A review. Journal of Health Informatics Research, 2(1), 1–18.

Chen, L., Zhao, Q., & Wang, X. (2023). Ensemble learning for chronic kidney disease classification: A review. IEEE Transactions on Biomedical Engineering, 70(2), 489–498. El Kharoua, R. (2024). Chronic kidney disease dataset [Data set]. Kaggle. https://www.kaggle.com/datasets/rabieelkharoua/chronic-kidney-disease-dataset

Garcia, M., Torres, R., & Fernandez, A. (2022). Handling missing data in chronic kidney disease research: Techniques and implications. BMC Medical Informatics and Decision Making, 22(1), Article 23.

Johnson, R., Smith, A., & Lee, J. (2023). Enhancing CKD prediction models through feature engineering and dimensionality reduction. Journal of Biomedical Informatics, 128, Article 103891. https://doi.org/10.1016/j.jbi.2022.103891

Kora, P., & Kalva, S. K. (2017). A comprehensive approach to predicting CKD using machine learning algorithms. Journal of Medical Systems, 41(7), Article 116. https://doi.org/10.1007/s10916-017-0726-x

Kumar, V., Sharma, A., & Singh, P. (2021). Deep learning for renal image analysis: Enhancing CKD diagnosis with convolutional neural networks. Medical Image Analysis, 69, Article 101966. https://doi.org/10.1016/j.media.2021.101966

Lee, S. H., Kim, M. J., & Park, S. Y. (2022). Personalized treatment strategy for CKD using clustering algorithms. Journal of Healthcare Engineering, 2022, Article 5628435. https://doi.org/10.1155/2022/5628435

Li, J., Wang, Y., & Huang, C. (2019). Machine learning in identifying risk factors for CKD in diabetic patients. Journal of Diabetes Research, 2019, Article 6758952. https://doi.org/10.1155/2019/6758952

Liu, X., Yang, Y., & Chen, H. (2022). Ethical considerations and bias mitigation in data mining for chronic kidney disease. Health Informatics Journal, 28(1), 135–148. https://doi.org/10.1177/14604582221078XXX

Nguyen, T., Vu, H., & Bui, T. (2023). Implementing predictive models for CKD in clinical settings: A case study. Health Information Science and Systems, 11(1), Article 12.

Patel, K. M., Desai, M. M., & Shah, R. K. (2021). Exploring urinary biomarkers for CKD diagnosis using data mining techniques. BioMed Research International, 2021, Article 3891283. https://doi.org/10.1155/2021/3891283

Patel, S., & Sharma, R. (2024). Explainable AI for chronic kidney disease prediction: Improving model transparency and trust. Artificial Intelligence in Medicine, 138, Article 102458. https://doi.org/10.1016/j.artmed.2023.102458

Pradhan, A., Sahu, T., & Raj, N. (2020). Classification of chronic kidney disease using decision tree algorithm: An analysis. International Journal of Scientific Research in Computer Science and Engineering, 8(1), 21–26.

Sinha, R., Bhardwaj, A., & Gupta, P. (2023). Comparative analysis of machine learning algorithms for CKD prediction. Computers in Biology and Medicine, 143, Article 105462. https://doi.org/10.1016/j.compbiomed.2022.105462

Swets, J. A. (1988). Measuring the accuracy of diagnostic systems. Science, 240(4857), 1285–1293. https://doi.org/10.1126/science.3287615

Thomas, J., Reddy, A., & Patel, N. (2021). Integrating genomic data with clinical information for enhanced CKD prediction: A data mining approach. Genomics, 113(4), 2085–2094. https://doi.org/10.1016/j.ygeno.2021.03.030

Wang, X., Liu, Y., & Zhang, H. (2022). Time-series analysis for chronic kidney disease progression monitoring using recurrent neural networks. IEEE Transactions on Neural Networks and Learning Systems, 33(6), 2457–2469.

Wang, Y., Zheng, L., & Wang, Z. (2020). Privacy-preserving techniques for data mining in healthcare: A survey. Journal of Biomedical Informatics, 104, Article 103400. https://doi.org/10.1016/j.jbi.2020.103400

Zhang, Y., Liu, J., & Li, X. (2021). Handling imbalanced data in CKD prediction: Techniques and applications. International Journal of Data Science and Analytics, 11(4), 365–380.

Zhao, S., Wang, H., & Zhang, L. (2022). Improving the interpretability of machine learning models for chronic kidney disease. Journal of Medical Informatics, 166, Article 104820. https://doi.org/10.1016/j.ijmedinf.2022.104820

Downloads

Published

2026-05-15

How to Cite

Anagu, E. J., Abe, G. T., Sabo, V. Z., & Lamiri, S. J. (2026). Optimizing Chronic Kidney Disease Prediction Via Ensemble Learning On Imbalanced Multi-Feature Clinical Data. Brilliance: Research of Artificial Intelligence, 6(2), 193–203. https://doi.org/10.47709/brilliance.v6i2.8210