Latent Semantic Regularization: Enhancing Semantic Integrity in Tabular Data Synthesis

Saba Amiri, Carlijn Nijhuis, Eric Nalisnick, Adam Belloum, Sander Klous, Leon Gommans
Proceedings of The 1st Symposium on Probabilistic Machine Learning, PMLR 327:425-443, 2026.

Abstract

Generative models trained on finite data could potentially assign non-negligible probability mass to regions that are statistically plausible but semantically invalid as a structural consequence of distribution estimation from samples. We propose Latent Semantic Regularization (LSR), which learns implicit semantic constraints directly from data and uses them to regularize a generative model, requiring no explicit constraint definitions, feasibility oracles, or negative examples. We instantiate LSR with a Conditional VAE using a tail- adaptive normalizing flow prior as the validator and a WGAN-GP as the synthesizer. We also introduce Exploration Factor metric measuring exploration/exploitation, and a controlled semantic integrity protocol based on injected zero-probability constraints with known ground truth. Across five benchmark datasets and against GAN- based, diffusion-based, and LLM-based baselines, LSR reduces semantic violation rates consistently while remaining competitive on statistical fidelity and downstream utility.

Cite this Paper


BibTeX
@InProceedings{pmlr-v327-amiri26a, title = {Latent Semantic Regularization: Enhancing Semantic Integrity in Tabular Data Synthesis}, author = {Amiri, Saba and Nijhuis, Carlijn and Nalisnick, Eric and Belloum, Adam and Klous, Sander and Gommans, Leon}, booktitle = {Proceedings of The 1st Symposium on Probabilistic Machine Learning}, pages = {425--443}, year = {2026}, editor = {Swaroop, Siddharth and RĂ¼gamer, David and Kristiadi, Agustinus}, volume = {327}, series = {Proceedings of Machine Learning Research}, month = {05 Jul}, publisher = {PMLR}, pdf = {https://raw.githubusercontent.com/mlresearch/v327/main/assets/amiri26a/amiri26a.pdf}, url = {https://proceedings.mlr.press/v327/amiri26a.html}, abstract = { Generative models trained on finite data could potentially assign non-negligible probability mass to regions that are statistically plausible but semantically invalid as a structural consequence of distribution estimation from samples. We propose Latent Semantic Regularization (LSR), which learns implicit semantic constraints directly from data and uses them to regularize a generative model, requiring no explicit constraint definitions, feasibility oracles, or negative examples. We instantiate LSR with a Conditional VAE using a tail- adaptive normalizing flow prior as the validator and a WGAN-GP as the synthesizer. We also introduce Exploration Factor metric measuring exploration/exploitation, and a controlled semantic integrity protocol based on injected zero-probability constraints with known ground truth. Across five benchmark datasets and against GAN- based, diffusion-based, and LLM-based baselines, LSR reduces semantic violation rates consistently while remaining competitive on statistical fidelity and downstream utility. } }
Endnote
%0 Conference Paper %T Latent Semantic Regularization: Enhancing Semantic Integrity in Tabular Data Synthesis %A Saba Amiri %A Carlijn Nijhuis %A Eric Nalisnick %A Adam Belloum %A Sander Klous %A Leon Gommans %B Proceedings of The 1st Symposium on Probabilistic Machine Learning %C Proceedings of Machine Learning Research %D 2026 %E Siddharth Swaroop %E David RĂ¼gamer %E Agustinus Kristiadi %F pmlr-v327-amiri26a %I PMLR %P 425--443 %U https://proceedings.mlr.press/v327/amiri26a.html %V 327 %X Generative models trained on finite data could potentially assign non-negligible probability mass to regions that are statistically plausible but semantically invalid as a structural consequence of distribution estimation from samples. We propose Latent Semantic Regularization (LSR), which learns implicit semantic constraints directly from data and uses them to regularize a generative model, requiring no explicit constraint definitions, feasibility oracles, or negative examples. We instantiate LSR with a Conditional VAE using a tail- adaptive normalizing flow prior as the validator and a WGAN-GP as the synthesizer. We also introduce Exploration Factor metric measuring exploration/exploitation, and a controlled semantic integrity protocol based on injected zero-probability constraints with known ground truth. Across five benchmark datasets and against GAN- based, diffusion-based, and LLM-based baselines, LSR reduces semantic violation rates consistently while remaining competitive on statistical fidelity and downstream utility.
APA
Amiri, S., Nijhuis, C., Nalisnick, E., Belloum, A., Klous, S. & Gommans, L.. (2026). Latent Semantic Regularization: Enhancing Semantic Integrity in Tabular Data Synthesis. Proceedings of The 1st Symposium on Probabilistic Machine Learning, in Proceedings of Machine Learning Research 327:425-443 Available from https://proceedings.mlr.press/v327/amiri26a.html.

Related Material