Skip to main content
What you can do with Local (on-device) through the harness, by feature family: the capability rows you can rely on (linked to vendor docs) and the parameters you can set for each. Configure parameters through the workflow surfaces described in the Workflow Schema — model/turn/budget fields on agent, provider knobs under harness_config.sdk_settings.local, and tool/sandbox policy at top level.

How to read this page

Decision rules per capability state — what YOU (the reader/agent) should do: Parameter table columns: Parameter is the provider-side path the harness maps for you (you set it via workflow fields or harness_config.sdk_settings.<provider> knobs — see Runtimes for which knobs exist). Default applies when you say nothing. Allowed is exhaustive — values outside it fail validation. Risk is deeda’s policy weight: high parameters generally require elevated tool_policy/sandbox_profile and may trigger human approval on hot-reload.

Core generation

Capabilities (4/4 rows usable):
  • local.llamacpp.openai_compat (llm.complete) — vendor docs
  • local.llamacpp.server (llm.complete) — vendor docs
  • local.ollama.generate (llm.complete) — vendor docs
  • local.ollama.openai_compat (llm.complete) — vendor docs
Parameters (7):

llama-cpp-python

Capabilities (13/13 rows usable):
  • local.llamacpp.python.create_chat_completion (llm.chat) — vendor docs
  • local.llamacpp.python.create_completion (llm.complete) — vendor docs
  • local.llamacpp.python.create_embedding (llm.embed) — vendor docs
  • local.llamacpp.python.eval_sample_generate (llm.streaming) — vendor docs
  • local.llamacpp.python.from_pretrained (provider.models) — vendor docs
  • local.llamacpp.python.llama_cache_state (provider.slots) — vendor docs
  • local.llamacpp.python.llama_class (provider.models) — vendor docs
  • local.llamacpp.python.llama_grammar (llm.structured_output) — vendor docs
  • local.llamacpp.python.logits_processor (llm.sampling) — vendor docs
  • local.llamacpp.python.save_load_state (provider.slots) — vendor docs
  • local.llamacpp.python.server_module (provider.lifecycle) — vendor docs
  • local.llamacpp.python.stopping_criteria (llm.sampling) — vendor docs
  • local.llamacpp.python.tokenize_detokenize (llm.tokenize) — vendor docs
Parameters (13):

llama.cpp CLI

Capabilities (4/4 rows usable):
  • local.llamacpp.bench (eval.benchmark) — vendor docs
  • local.llamacpp.cli (provider.cli) — vendor docs
  • local.llamacpp.model_acquisition_cache (provider.models) — vendor docs
  • local.llamacpp.perplexity (eval.perplexity) — vendor docs
Parameters (4):

llama.cpp CLI Tools

Capabilities (15/20 rows usable):
  • local.llamacpp.cli.batched (eval.benchmark) — vendor docs
  • local.llamacpp.cli.batched_bench (eval.benchmark) — vendor docs
  • local.llamacpp.cli.embedding (llm.embed) — vendor docs
  • local.llamacpp.cli.gguf_inspect (provider.diagnostics) — vendor docs
  • local.llamacpp.cli.gguf_split (file.split_merge) — vendor docs
  • local.llamacpp.cli.imatrix (provider.quantization) — vendor docs
  • local.llamacpp.cli.lookahead (llm.speculative_decoding) — vendor docs
  • local.llamacpp.cli.mtmd_cli (media.multimodal) — vendor docs
  • local.llamacpp.cli.parallel (eval.benchmark) — vendor docs
  • local.llamacpp.cli.passkey (eval.benchmark) — vendor docs
  • local.llamacpp.cli.quantize (provider.quantization) — vendor docs
  • local.llamacpp.cli.retrieval (llm.rag) — vendor docs
  • local.llamacpp.cli.simple (llm.complete) — vendor docs
  • local.llamacpp.cli.simple_chat (llm.chat) — vendor docs
  • local.llamacpp.cli.tokenize (llm.tokenize) — vendor docs
Parameters (15):

llama.cpp Evaluation

Capabilities (1/1 rows usable):

llama.cpp Quant Types

Capabilities (7/7 rows usable):
  • local.llamacpp.quant.bf16_f16_f32 (provider.quantization) — vendor docs
  • local.llamacpp.quant.iq_extreme (provider.quantization) — vendor docs
  • local.llamacpp.quant.iq2 (provider.quantization) — vendor docs
  • local.llamacpp.quant.iq3 (provider.quantization) — vendor docs
  • local.llamacpp.quant.iq4 (provider.quantization) — vendor docs
  • local.llamacpp.quant.k_quants (provider.quantization) — vendor docs
  • local.llamacpp.quant.legacy_q (provider.quantization) — vendor docs
Parameters (7):

llama.cpp Runtime

Capabilities (4/7 rows usable):
  • local.llamacpp.runtime.cpu_memory (provider.runtime) — vendor docs
  • local.llamacpp.runtime.kv_cache_context (provider.context) — vendor docs
  • local.llamacpp.runtime.threads_batch (provider.runtime) — vendor docs
  • local.llamacpp.sampling_controls (llm.sampling) — vendor docs
Parameters (4):

llama.cpp Server Anthropic Format

Capabilities (2/2 rows usable):
  • local.llamacpp.server.anthropic_count_tokens (anthropic.messages.count_tokens) — vendor docs
  • local.llamacpp.server.anthropic_messages (anthropic.messages) — vendor docs
Parameters (2):

llama.cpp Server Native

Capabilities (21/26 rows usable):
  • local.llamacpp.server.apply_template (llm.chat_template) — vendor docs
  • local.llamacpp.server.auth_tls (provider.auth) — vendor docs
  • local.llamacpp.server.completion_native (llm.completion) — vendor docs
  • local.llamacpp.server.detokenize (llm.tokenize) — vendor docs
  • local.llamacpp.server.embeddings_native (llm.embedding) — vendor docs
  • local.llamacpp.server.gpu_backend (provider.gpu_offload) — vendor docs
  • local.llamacpp.server.grammar (llm.structured_output) — vendor docs
  • local.llamacpp.server.health (provider.health) — vendor docs
  • local.llamacpp.server.infill (llm.fim) · model-dependentvendor docs
  • local.llamacpp.server.lora_adapters (tuning.lora_runtime) · model-dependentvendor docs
  • local.llamacpp.server.metrics (provider.metrics) — vendor docs
  • local.llamacpp.server.parallel_batching (provider.parallel_decoding) — vendor docs
  • local.llamacpp.server.props (provider.runtime_config) — vendor docs
  • local.llamacpp.server.props_post (provider.runtime_config) — vendor docs
  • local.llamacpp.server.reasoning (llm.reasoning) · model-dependentvendor docs
  • local.llamacpp.server.reranking (llm.rerank) — vendor docs
  • local.llamacpp.server.slots (provider.slots) — vendor docs
  • local.llamacpp.server.slots_save_restore (provider.slots) — vendor docs
  • local.llamacpp.server.speculative (llm.speculative_decoding) — vendor docs
  • local.llamacpp.server.tokenize (llm.tokenize) — vendor docs
  • local.llamacpp.server.webui (docs.webui) — vendor docs
Parameters (20):

llama.cpp Server OpenAI Format

Capabilities (2/2 rows usable): Parameters (1):

LocalAI Anthropic Format

Capabilities (1/1 rows usable):
  • local.localai.anthropic_messages (anthropic.messages) — vendor docs

LocalAI Backends

Capabilities (1/23 rows usable):
  • local.localai.backend.llamacpp (provider.backend) — vendor docs

LocalAI Galleries

Capabilities (2/6 rows usable):
  • local.localai.gallery_available (provider.gallery) — vendor docs
  • local.localai.gallery_jobs (provider.gallery) — vendor docs

LocalAI Ollama Format

Capabilities (1/1 rows usable):
  • local.localai.ollama_compat (llm.complete) — vendor docs

LocalAI OpenAI Format

Capabilities (3/16 rows usable):
  • local.localai.openai_chat (llm.chat) — vendor docs
  • local.localai.openai_completions (llm.completion) — vendor docs
  • local.localai.openai_models (provider.models) — vendor docs

MLX Apple Platform

Capabilities (2/2 rows usable):
  • local.mlx.platform.lazy_eval (provider.runtime) — vendor docs
  • local.mlx.platform.macos_unified_memory (provider.gpu_offload) — vendor docs

MLX Distributed

Capabilities (2/2 rows usable):
  • local.mlx.distributed.launch (provider.distributed_inference) — vendor docs
  • local.mlx.distributed.primitives (provider.distributed_inference) — vendor docs

MLX Examples

Capabilities (2/12 rows usable):

MLX Fast Kernels

Capabilities (5/5 rows usable):
  • local.mlx.fast.metal_kernel (provider.runtime) — vendor docs
  • local.mlx.fast.quantized_matmul (provider.quantization) — vendor docs
  • local.mlx.fast.rms_norm (provider.runtime) — vendor docs
  • local.mlx.fast.rope (provider.runtime) — vendor docs
  • local.mlx.fast.scaled_dot_product_attention (provider.attention_backend) — vendor docs

MLX Optimizers

Capabilities (1/1 rows usable):
  • local.mlx.optimizers (tuning.training_reference) — vendor docs

MLX Profiling

Capabilities (3/3 rows usable):
  • local.mlx.metal.cache_limit (provider.gpu_offload) — vendor docs
  • local.mlx.metal.capture (provider.observability) — vendor docs
  • local.mlx.utils.tree (provider.runtime) — vendor docs

MLX-LM CLI

Capabilities (10/17 rows usable):

MLX-LM Python SDK

Capabilities (7/9 rows usable):
  • local.mlx.lm.kv_cache_quantized (provider.kv_cache) — vendor docs
  • local.mlx.lm.kv_cache_rotating (provider.kv_cache) — vendor docs
  • local.mlx.lm.py_generate (llm.complete) — vendor docs
  • local.mlx.lm.py_load (provider.models) — vendor docs
  • local.mlx.lm.py_prompt_cache (provider.slots) — vendor docs
  • local.mlx.lm.py_sample_utils (llm.sampling) — vendor docs
  • local.mlx.lm.py_stream_generate (llm.streaming) — vendor docs

MLX-LM Server

Capabilities (1/1 rows usable):
  • local.mlx.lm.speculative (llm.speculative_decoding) — vendor docs

Ollama Anthropic Format

Capabilities (1/3 rows usable):
  • local.ollama.anthropic_messages (anthropic.messages) — vendor docs
Parameters (1):

Ollama Blobs

Capabilities (2/2 rows usable):
  • local.ollama.api_blobs_head (file.exists) — vendor docs
  • local.ollama.api_blobs_post (file.upload) — vendor docs
Parameters (2):

Ollama CLI

Capabilities (6/7 rows usable):
  • local.ollama.cli_cp (provider.models) — vendor docs
  • local.ollama.cli_pull_rm_ls (provider.models) — vendor docs
  • local.ollama.cli_run (llm.chat) — vendor docs
  • local.ollama.cli_serve (provider.lifecycle) — vendor docs
  • local.ollama.cli_show (provider.admin.read) — vendor docs
  • local.ollama.cli_stop (provider.lifecycle) — vendor docs
Parameters (6):

Ollama Environment

Capabilities (13/15 rows usable):
  • local.ollama.env.context_length (provider.context) — vendor docs
  • local.ollama.env.debug (provider.observability) — vendor docs
  • local.ollama.env.flash_attention (provider.attention_backend) — vendor docs
  • local.ollama.env.gpu_overhead (provider.gpu_offload) — vendor docs
  • local.ollama.env.host (provider.connectivity) — vendor docs
  • local.ollama.env.keep_alive (provider.lifecycle) — vendor docs
  • local.ollama.env.kv_cache_type (provider.kv_cache) — vendor docs
  • local.ollama.env.max_loaded (provider.lifecycle) — vendor docs
  • local.ollama.env.max_queue (provider.parallel_decoding) — vendor docs
  • local.ollama.env.models_dir (file.manage) — vendor docs
  • local.ollama.env.num_parallel (provider.parallel_decoding) — vendor docs
  • local.ollama.env.origins (provider.connectivity) — vendor docs
  • local.ollama.env.sched_spread (provider.gpu_offload) — vendor docs
Parameters (13):

Ollama Generate

Capabilities (6/6 rows usable): Parameters (5):

Ollama Model Management

Capabilities (11/11 rows usable): Parameters (8):

Ollama Modelfile

Capabilities (2/2 rows usable):
  • local.ollama.context_length (provider.context) — vendor docs
  • local.ollama.modelfile (provider.modelfile) — vendor docs
Parameters (2):

Ollama OpenAI Format

Capabilities (6/6 rows usable): Parameters (5):

Ollama Server

Capabilities (1/1 rows usable):
  • local.ollama.api_version (provider.health) — vendor docs
Parameters (1):

Ollama Streaming

Capabilities (1/1 rows usable):
  • local.ollama.streaming (llm.streaming) — vendor docs
Parameters (1):

Ollama Structured Output

Concept guide: Structured Output — what this is, when to use it, and how to express it in workflow markdown.
Capabilities (1/1 rows usable):
  • local.ollama.structured_outputs (llm.structured_output) — vendor docs
Parameters (1):

Ollama Thinking

Concept guide: Thinking & Reasoning — what this is, when to use it, and how to express it in workflow markdown.
Capabilities (1/1 rows usable):

Ollama Vision

Capabilities (2/2 rows usable):

ollama-js SDK

Capabilities (3/5 rows usable):
  • local.ollama.js_abort_method (llm.cancel) — vendor docs
  • local.ollama.js_async_iterator (llm.streaming) — vendor docs
  • local.ollama.js_client_class (provider.admin.read) — vendor docs
Parameters (3):

ollama-python SDK

Capabilities (10/11 rows usable):
  • local.ollama.python_async_client (provider.admin.read) — vendor docs
  • local.ollama.python_chat_method (llm.chat) — vendor docs
  • local.ollama.python_client_class (provider.admin.read) — vendor docs
  • local.ollama.python_copy_delete (provider.models) — vendor docs
  • local.ollama.python_create_modelfile (provider.models) — vendor docs
  • local.ollama.python_embed_method (llm.embed) — vendor docs
  • local.ollama.python_generate_method (llm.complete) — vendor docs
  • local.ollama.python_list_method (provider.models) — vendor docs
  • local.ollama.python_ps_method (provider.lifecycle) — vendor docs
  • local.ollama.python_show_method (provider.admin.read) — vendor docs
Parameters (10):

Retrieval/files/embeddings

Capabilities (4/4 rows usable):
  • local.ollama.embed_dimensions (llm.embed) — vendor docs
  • local.ollama.embed_truncate (llm.embed) — vendor docs
  • local.ollama.embeddings (llm.embed) — vendor docs
  • local.ollama.embeddings_legacy (llm.embed) — vendor docs
Parameters (4):

Tools

Concept guide: Tools & MCP — what this is, when to use it, and how to express it in workflow markdown.
Capabilities (1/1 rows usable):