/
githubmirror
/
ColossalAI
Обзор
Документация
Войти
/
githubmirror
/
ColossalAI
Код
Запросы
0
Пакеты
0
Релизы
0
Аналитика
Безопасность
v0.3.7
ColossalAI
/
applications
/
ColossalChat
/
..
benchmarks
[ColossalChat] Update RLHF V2 (#5286)
2 года назад
coati
[ColossalChat] Update RLHF V2 (#5286)
2 года назад
config
[ColossalChat] Update RLHF V2 (#5286)
2 года назад
examples
[devops] remove post commit ci (#5566)
2 года назад
tests
[ColossalChat] Update RLHF V2 (#5286)
2 года назад
.gitignore
[ColossalChat] Update RLHF V2 (#5286)
2 года назад
LICENSE
[ColossalChat] Update RLHF V2 (#5286)
2 года назад
README.md
[ColossalChat] Update RLHF V2 (#5286)
2 года назад
pytest.ini
[ColossalChat] Update RLHF V2 (#5286)
2 года назад
requirements.txt
[ColossalChat] Update RLHF V2 (#5286)
2 года назад
setup.py
[ColossalChat] Update RLHF V2 (#5286)
2 года назад
version.txt
[ColossalChat] Update RLHF V2 (#5286)
2 года назад
Table of Contents
What Is ColossalChat And Coati ?
Online demo
Install
Install the Environment
How To Use?
RLHF Training Stage1 - Supervised Instructs Tuning
Step 1: Data Collection
Step 2: Preprocessing
Step 3: Training
RLHF Training Stage2 - Training Reward Model
Step 1: Data Collection
Step 2: Preprocessing
Step 3: Training
RLHF Training Stage3 - Proximal Policy Optimization
Step 1: Data Collection
Step 2: Data Preprocessing
Step 3: Training
Alternative Option For RLHF: Direct Preference Optimization
DPO Training Stage1 - Supervised Instructs Tuning
DPO Training Stage2 - DPO Training
Step 1: Data Collection & Preparation
Step 2: Training
Inference Quantization and Serving - After Training
Coati7B examples
Generation
Open QA
Limitation
FAQ
The Plan
Real-time progress
Invitation to open-source contribution
Quick Preview
Authors
Citations
Licenses
README.md