Workshop
Serving Open Models with vLLM on RunPod
Serving an open-source model yourself means renting a GPU and running an inference server on it. In this workshop we take a quantized DeepSeek model and rent a GPU by the hour on RunPod. We serve it …
Tue, Jun 2, 2026 · 02:00
Watch recording
Main or above