Qin Zhu, Qinyuan Cheng, Runyu Peng, Xiaonan Li, Ru Peng, Tengxiao Liu, Xipeng Qiu, Xuanjing Huang: Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation. EMNLP (Findings) 2024: 9113-9129