Halludial: A Large-scale Benchmark for Automatic Dialogue-level Hallucination Evaluation

Published in arXiv preprint arXiv:2406.07070, 2024

Recommended citation: W. Luo, T. Shen, Wei Li, G. Peng, R. Xuan, H. Wang, and X. Yang. (2024). "Halludial: A Large-scale Benchmark for Automatic Dialogue-level Hallucination Evaluation." arXiv preprint arXiv:2406.07070.
Download Paper