Skip to content

other

Reinforcement Learning from Human Feedback

Preference-based tuning technique cited as a possible source of the models' user-agreement tendency.

Known aliases

  • Reinforcement learning from human feedback
  • RLHF

Relationships

No evidence-backed relationships are recorded.

Current stories