Pure Rust + CUDA LLM inference engine — no PyTorch, OpenAI-compatible, serves Qwen3 to Kimi-K2

cuda cuda-kernels deepseek gpu inference inference-engine kimi kimi-k2 kv-cache llm llm-inference llm-serving model-serving moe openai-api paged-attention qwen qwen3 rust vllm
0 Open Issues Need Help Last updated: Aug 5, 2026

Open Issues Need Help

View All on GitHub

No open issues

This project doesn't have any open help-wanted issues at the moment.