Quay về trang chủ
Blog

Điều Phối Workload Suy Luận LLM Phân Tán Với KServe, Ray Và Dynamic GPU Bin-Packing Trên K8s

Điều phối các workload suy luận LLM phân tán với KServe, Ray Serve và gom cụm GPU trên Kubernetes nhằm tối ưu hóa độ trễ cũng như hiệu suất phần cứng.

7 phút đọc