main
Changes for orcacode experiment (#3612)
[Fix] Consume much more gpt memory running eval_rm (#3614)
Update Flash Attention forward for Llama 2: (#3595)
fix: unsupported message typo (#3658)
Dev zhanglu (#3649)
Rl training (#2206)
update READMEs (#3487)
Add GPTNeoXRewardModel (#2182)
Fix typo in check_dataset_appearances.py (#3205)
sft8 training preparation (#2988)
fix bug
augment rank results for reward model and some other improvements for RM training (#2321)
Use `rng_seed` param when creating custom dataset sampler (#3592)