arXiv Paper Proposes Black-Box Membership Inference via Word-Level Probabilities
A new arXiv preprint introduces a membership inference method that estimates word-level probabilities to detect whether text appeared in a language model's training data. The approach targets black-box settings, where attackers lack direct access to model internals. It aims to improve privacy auditing of large language models.