Skip to content

other

DAPO

GRPO-derived reinforcement learning method for language models. It adds dynamic sampling to discard prompt groups with zero reward variance.

Current clusters