diff --git a/stacks/llm/llama-swap-config.yaml b/stacks/llm/llama-swap-config.yaml index d8caee7..1b1daec 100644 --- a/stacks/llm/llama-swap-config.yaml +++ b/stacks/llm/llama-swap-config.yaml @@ -15,7 +15,9 @@ healthCheckTimeout: 300 logLevel: info macros: - common: "-ngl 99 --parallel 1 --ctx-size 65536 --flash-attn on --cache-type-k q8_0 --cache-type-v q8_0" + # --jinja applies each model's embedded chat template (REQUIRED for gpt-oss' + # harmony format, else content comes back empty; harmless/correct for gemma4). + common: "-ngl 99 --parallel 1 --ctx-size 65536 --flash-attn on --cache-type-k q8_0 --cache-type-v q8_0 --jinja" models: "gpt-oss-20b":