Distributed Inference
Multi-node tensor-parallel LLM inference for Spice.ai Enterprise, splitting a single model across nodes over a pure-TCP ring backend.
Configuration
models:
- name: glm
from: huggingface:huggingface.co/THUDM/glm-4-9b-chat
params:
model_type: glm4 # glm4, glm4moe, or glm4moelite
distributed_backend: ring # none (default, single-node) | ring
nodes: 10.0.4.21,10.0.4.22 # identical on every node, ordered by rank
node_rank: 0 # this node's rank; set node_rank: 1 on 10.0.4.22Parameter
Description
Constraints
See also
Last updated
Was this helpful?