v0.2.3
added skip_bias_add for non-tp linear
[setup] support pre-build and jit-build of cuda kernels (#2374)
[tensorparallel] fixed tp layers (#1938)
[utils] refactor parallel layers checkpoint and bcast model on loading checkpoint (#1548)
improved allgather & reducescatter for 3d
[NFC] polish colossalai/nn/layer/parallel_sequence/layers.py code style (#1280)
[NFC] polish colossalai/nn/layer/utils/common.py code style (#983)
[NFC] polish colossalai/nn/layer/wrapper/pipeline_wrapper.py code style (#1303)
[MOE] changed parallelmode to dist process group (#460)