From 74791105b3927d5d1883cbcf424176e5dd70c1fe Mon Sep 17 00:00:00 2001 From: ginnoir Date: Fri, 26 Jun 2026 16:42:41 -0500 Subject: [PATCH] fix(llm): --parallel 1 so a single request gets the full 64k context With the default 4 slots, llama-server splits ctx into 32k per sequence, which fails Hermes' 64K minimum. One slot serves the full 65536 per request (serial agent use; concurrent calls queue). Co-Authored-By: Claude Opus 4.8 --- stacks/llm/docker-compose.yml | 2 ++ 1 file changed, 2 insertions(+) diff --git a/stacks/llm/docker-compose.yml b/stacks/llm/docker-compose.yml index 743e5b5..84a4246 100644 --- a/stacks/llm/docker-compose.yml +++ b/stacks/llm/docker-compose.yml @@ -32,6 +32,8 @@ services: - "/models/Qwen2.5-14B-Instruct-Q4_K_M.gguf" - "--alias" - "qwen2.5-14b-instruct" + - "--parallel" + - "1" - "-ngl" - "99" - "--ctx-size"