2026.08.16 llm 서빙 4편. 멀티 모델 - LRU 캐시와 Triton 위임 한 서비스가 여러 모델을 나눠 쓰는 구조와, 무엇을 메모리에 올려둘지 정하는 캐시 정책, 그리고 비용과 지연 사이의 맞바꿈 multi-model-serving triton lru-cache llm-serving