From 13424fcf75875669169a6e2e91e1d2b2177160d4 Mon Sep 17 00:00:00 2001 From: ginnoir Date: Fri, 26 Jun 2026 16:45:33 -0500 Subject: [PATCH] fix(llm): override-kv context_length=65536 so slot isn't capped to 32k llama-server caps the slot to the GGUF training context (32768) and ignores the YaRN-extended size, leaving per-seq context at 32k. Raise qwen2.context_length metadata to 65536 so the full window is served per request. Co-Authored-By: Claude Opus 4.8 --- stacks/llm/docker-compose.yml | 2 ++ 1 file changed, 2 insertions(+) diff --git a/stacks/llm/docker-compose.yml b/stacks/llm/docker-compose.yml index 84a4246..3721c3e 100644 --- a/stacks/llm/docker-compose.yml +++ b/stacks/llm/docker-compose.yml @@ -44,6 +44,8 @@ services: - "2" - "--yarn-orig-ctx" - "32768" + - "--override-kv" + - "qwen2.context_length=int:65536" - "--flash-attn" - "on" - "--cache-type-k"