An open API service for producing an overview of a list of open source projects.

Collections: awesome-llama

https://github.com/PKU-Alignment/llms-resist-alignment

[ACL2025 Best Paper] Language Models Resist Alignment

ai-safety alignment alpaca llama llama2 llama3 llm llms rlhf safe safe-rlhf vicuna

Last synced: 19 Aug 2026

https://github.com/PKU-Alignment/safe-rlhf

Safe RLHF: Constrained Value Alignment via Safe Reinforcement Learning from Human Feedback

ai-safety alpaca beaver datasets deepspeed gpt large-language-models llama llm llms reinforcement-learning reinforcement-learning-from-human-feedback rlhf safe-reinforcement-learning safe-reinforcement-learning-from-human-feedback safe-rlhf safety transformer transformers vicuna

Last synced: 19 Aug 2026

https://github.com/PKU-Alignment/beavertails

BeaverTails is a collection of datasets designed to facilitate research on safety alignment in large language models (LLMs).

ai-safety beaver datasets gpt human-feedback human-feedback-data language-model large-language-model llama llm llms rlhf safe-rlhf safety

Last synced: 19 Aug 2026

Statistics

  • Projects: 2,239
  • Last updated: about 2 years ago