Synthetic Data Augmentation for Imbalanced Tabular Protein Subcellular Localization: A Comparative Study of SMOTE, CTGAN, TVAE, and TabDDPM Methods

dc.contributor.authorGunduz, Ali Fatih
dc.contributor.authorSahin, Canan Batur
dc.date.accessioned2026-06-19T06:37:53Z
dc.date.available2026-06-19T06:37:53Z
dc.date.issued2026
dc.departmentMalatya Turgut Özal Üniversitesi
dc.description.abstractClass imbalance is a persistent challenge in supervised machine learning, particularly in biological datasets where minority classes represent functionally critical categories. Synthetic data generation has emerged as a principal strategy for mitigating this problem, yet systematic comparisons of classical and modern deep generative approaches remain limited. This study presents a comprehensive benchmark evaluation of four synthetic data generation methods-SMOTE, CTGAN, TVAE, and TabDDPM-across two well-established biological datasets from the UCI Machine Learning Repository: the E. coli protein localization dataset (307 samples, 6 features, 4 classes) and the yeast protein localization dataset (1299 samples, 8 features, 4 classes). Synthetic data quality was rigorously assessed using a multi-dimensional evaluation framework encompassing distributional fidelity (Fr & eacute;chet Distance, Wasserstein Distance), machine learning utility (Train-on-Synthetic-Test-on-Real and Train-on-Real-Test-on-Real protocols using XGBoost version 3.2.0, Logistic Regression, Support Vector Machines, and Random Forest), and distinguishability (Classifier Two-Sample Test). The datasets are rather imbalanced. During the experiments, the dataset size increased to three times its original size while preserving the imbalanced class-sample ratio. To evaluate the quality of synthetic data, the max(AUC,1-AUC) score is proposed. This score is inversely proportional to classification performance, indicating that synthetic data are not easily distinguishable from real data. Per-class analysis reveals that minority classes remain the primary challenge across all generative methods. SMOTE and TabDDPM obtained the highest predictive utility F1-scores across both datasets. TVAE offers the strongest distributional fidelity among deep generative models, producing synthetic samples that are most difficult to distinguish from real data (lowest C2ST scores). CTGAN exhibits significant performance degradation on both small- and medium-scale datasets, with F1 utility ratios below 0.50.
dc.identifier.doi10.3390/app16083694
dc.identifier.issn2076-3417
dc.identifier.issue8
dc.identifier.scopus2-s2.0-105036808507
dc.identifier.scopusqualityQ1
dc.identifier.urihttps://doi.org/10.3390/app16083694
dc.identifier.urihttps://hdl.handle.net/20.500.12899/5261
dc.identifier.volume16
dc.identifier.wosWOS:001749311900001
dc.identifier.wosqualityQ2
dc.indekslendigikaynakWeb of Science
dc.indekslendigikaynakScopus
dc.language.isoen
dc.publisherMdpi
dc.relation.ispartofApplied Sciences-Basel
dc.relation.publicationcategoryMakale - Uluslararası Hakemli Dergi - Kurum Öğretim Elemanı
dc.rightsinfo:eu-repo/semantics/openAccess
dc.snmzKA_WOS_20260612
dc.subjectClass Imbalance
dc.subjectSynthetic Data Generation
dc.subjectSmote
dc.subjectCtgan
dc.subjectTvae
dc.subjectTabddpm
dc.subjectTabular Data
dc.subjectBenchmark Comparison
dc.subjectTstr/Trtr Evaluation
dc.subjectProtein Localization
dc.titleSynthetic Data Augmentation for Imbalanced Tabular Protein Subcellular Localization: A Comparative Study of SMOTE, CTGAN, TVAE, and TabDDPM Methods
dc.typeArticle

Dosyalar