[edit]
Latent Semantic Regularization: Enhancing Semantic Integrity in Tabular Data Synthesis
Proceedings of The 1st Symposium on Probabilistic Machine Learning, PMLR 327:425-443, 2026.
Abstract
Generative models trained on finite data could potentially assign non-negligible probability mass to regions that are statistically plausible but semantically invalid as a structural consequence of distribution estimation from samples. We propose Latent Semantic Regularization (LSR), which learns implicit semantic constraints directly from data and uses them to regularize a generative model, requiring no explicit constraint definitions, feasibility oracles, or negative examples. We instantiate LSR with a Conditional VAE using a tail- adaptive normalizing flow prior as the validator and a WGAN-GP as the synthesizer. We also introduce Exploration Factor metric measuring exploration/exploitation, and a controlled semantic integrity protocol based on injected zero-probability constraints with known ground truth. Across five benchmark datasets and against GAN- based, diffusion-based, and LLM-based baselines, LSR reduces semantic violation rates consistently while remaining competitive on statistical fidelity and downstream utility.