kubernetes 7
- Kubernetes 1.37 DRA 업데이트: GPU 운영팀이 보는 GA급 변화
- GPU 오토스케일링으로 LLM 서빙 비용을 ‘진짜로’ 줄이는 법: Kubernetes 최신 패턴(DRA·KEDA·vLLM·llm-d)
- Kubernetes에서 LLM 서빙을 “GPU 오토스케일”로 굴리는 현실적인 방법: KEDA + (Queue Depth / KV Cache) + DCGM/NVML
- GPU가 병목인 LLM 서빙, Kubernetes에서 “제대로” 오토스케일링하는 법
- GPU 오토스케일링 2026: Kubernetes에서 LLM 서빙을 “GPU 기준”으로 제대로 스케일하는 법 (HPA/KEDA/DCGM/DRA/MIG 실전 조합)
- GPU 오토스케일링, “정답”은 GPU%가 아니라 KV Cache·Queue·SLO다
- Kubernetes에서 LLM 서빙을 “GPU 기준”으로 오토스케일링하기: KServe(vLLM) + KEDA + DCGM, 그리고 노드까지 따라오는 설계