main
Rl training (#2206)
Changes for orcacode experiment (#3612)
fix typos (#3216)
Add data loader for HF oasst1 (#2951)
fix typos (#3543)
Add flash-attention patch for falcon-7b (#3580)
Update configs according to feedback to #2277 (#2325)
Add max_replies parameter for trainer_rm (#2433)
Fix DeepSpeed 0.8.3 training (#2299)
sft8 training preparation (#2988)
Add LoRA and Prefix-Tuning as Modeling Options for Improved Memory Efficiency + performance (potentially) (#2840)