master
llama: automatically set parameters not set by the user in such a way that maximizes GPU utilization (#16653)
CUDA: manage NCCL communicators in context (#21891)
ggml : build backends as libraries (#10256)
docs : Minor cleanups (#19252)
ggml : fix ggml_gallocr_ptr type (ggml/1205)
ggml-cpu: FA split across kv for faster TG (#19209)
ggml: backend-agnostic tensor parallelism (experimental) (#19378)
Add experimental ggml-hexagon backend for the Hexagon NPU (#16547)
metal : refactor + optimize v2 (#15995)
Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693)
ggml : add OpenVINO backend (#15307)
chore : correct typos [no ci] (#20041)
rpc : add native RDMA transport for RPC backend (RoCEv2) (#20590)
ggml-virtgpu: make the code thread safe (#19204)
vulkan: Make Vulkan optional at runtime (#11493). (#11494)
ggml: Add initial WebGPU backend (#14521)
zdnn: refactor codebase + add docs (#16178)
ggml-zendnn : add ZenDNN backend for AMD CPUs (#17690)
docs: more extensive RoPE documentation [no ci] (#21953)
llama: fix llama-model-saver (#20503)