master
server : support multiple model aliases via comma-separated --alias (#19926)
server: Add cached_tokens info to oaicompat responses (#19361)
server: /v1/responses (partial) (#18486)
Propose fix a couple of typos (#21581)
memory : remove KV cache size padding (#16812)
llama : fix pooling assertion crash in chunked GDN detection path (#20468)
server: respect the ignore eos flag (#21203)
server : support unified cache across slots (#16736)
server: rename --clear-idle to --cache-idle-slots (#21741)
server : disable context shift by default (#15416)
server: Parse port numbers from MCP server URLs in CORS proxy (#20208)
server / ranking : add sorting and management of top_n (#16403)
server: Expose build_info in router mode (#21835)
server: Bypass API Key validation for WebUI static bundle assets (#21269)
server: add auto-sleep after N seconds of idle (#18228)
server : adjust spec tests to generate up to 16 tokens (#19093)
tests : use `reasoning` instead of `reasoning_budget` in server tests (#20432)
ci : switch from pyright to ty (#20826)
server: tests: fetch random media marker via /apply-template (#21962) (#21980)