What does Data-parallel serving mean in inference serving?
Data-parallel serving runs independent model replicas and routes different requests to each replica. Replicas do not combine memory or compute for a single request. A router balances admitted requests while respecting replica health, cache locality, and adapter availability. Capacity planning includes uneven request lengths and replica startup time.