2 items tagged with "alignment"
Mitigation strategies (RLHF, red-teaming, tiered access) for large language model deployment.
A benchmark for reward models and LLM judges that measures how well they prefer better responses over worse ones across chat, reasoning, safety, and refusal cases.