Skip to content

benchmark

WildGuardMix

Labelled dataset of benign and adversarial prompt-response pairs used to train and test safety moderation classifiers.

Current clusters