Collections: awesome-llama
https://github.com/PKU-Alignment/llms-resist-alignment
[ACL2025 Best Paper] Language Models Resist Alignment
ai-safety alignment alpaca llama llama2 llama3 llm llms rlhf safe safe-rlhf vicuna
Last synced: 19 Aug 2026
https://github.com/PKU-Alignment/safe-rlhf
Safe RLHF: Constrained Value Alignment via Safe Reinforcement Learning from Human Feedback
ai-safety alpaca beaver datasets deepspeed gpt large-language-models llama llm llms reinforcement-learning reinforcement-learning-from-human-feedback rlhf safe-reinforcement-learning safe-reinforcement-learning-from-human-feedback safe-rlhf safety transformer transformers vicuna
Last synced: 19 Aug 2026
https://github.com/PKU-Alignment/beavertails
BeaverTails is a collection of datasets designed to facilitate research on safety alignment in large language models (LLMs).
ai-safety beaver datasets gpt human-feedback human-feedback-data language-model large-language-model llama llm llms rlhf safe-rlhf safety
Last synced: 19 Aug 2026
Statistics
- Projects: 2,239
- Last updated: about 2 years ago