taxonomy

분류

카테고리는 글의 큰 맥락을 하나만 고르고, 태그는 다시 찾을 때 쓸 키워드로 붙입니다. 글이 늘어나도 이 페이지에서 주제별 입구를 유지합니다.

1 category · 40 tags · 15 notes

categories

카테고리

tags

태그

llm-d Kubernetes 위에서 vLLM 파드를 여러 개 두고 요청을 나눠 보내는 llm-d 라우터 기록입니다. 2 notes envoy 요청 경로 한가운데 서서 L7을 이해하는 프록시 Envoy의 구조와 확장 지점 기록입니다. 1 note ext-proc Envoy가 요청 처리를 외부 gRPC 서버에 위임하는 External Processing 필터 기록입니다. 1 note gateway-api Kubernetes Gateway API와 추론 서빙용 확장인 Inference Extension 기록입니다. 1 note kubernetes Deployment와 Service로 모델 서버를 띄우고 요청을 분산시킨 기록입니다. 4 notes trainium AWS가 설계한 AI 가속기 Trainium 위에서 모델을 서빙해본 기록입니다. 1 note neuron Trainium과 Inferentia를 다루는 소프트웨어 스택 Neuron SDK의 기록입니다. 1 note vllm vLLM의 배칭·메모리 선점 동작을 직접 재보고 비교한 기록입니다. 4 notes llm-serving LLM을 실제로 서비스할 때의 메모리·지연·처리량을 다루는 기록입니다. 9 notes awq 활성값 분포를 보고 중요한 가중치를 지키는 AWQ 4bit 양자화 기록입니다. 1 note quantization 가중치를 낮은 비트로 압축해 메모리를 줄이고 그 대가를 재본 양자화 기록입니다. 1 note kv-cache 이미 계산한 키와 값을 재사용해 생성을 빠르게 하는 KV Cache 기록입니다. 4 notes benchmark 같은 조건을 통제하고 처리량과 지연을 실제로 재서 비교한 기록입니다. 1 note prefix-caching 같은 프롬프트 앞부분을 이미 계산한 파드로 요청을 보내 재계산을 줄이는 기록입니다. 1 note speculative-decoding 작은 초안 모델이 추측한 토큰을 큰 모델이 한 번에 검증해 생성을 빠르게 하는 추측 디코딩 기록입니다. 1 note ring-attention KV Cache를 여러 장치에 나눠 담고 블록을 링으로 돌려 긴 컨텍스트를 처리하는 Ring Attention 기록입니다. 1 note long-context 컨텍스트가 길어질 때 늘어나는 KV Cache와 메모리 부담을 다루는 기록입니다. 1 note parallelism 모델을 여러 GPU에 나눠 담고 GPU 간 통신 병목을 다루는 병렬화 기록입니다. 1 note tensor-parallel 한 레이어의 가중치를 여러 GPU에 쪼개고 all-reduce로 합치는 Tensor Parallel 기록입니다. 1 note pipeline-parallel 모델을 레이어 단위로 나눠 GPU에 파이프라인처럼 흘려보내는 Pipeline Parallel 기록입니다. 1 note moe 토큰을 일부 전문가에게만 보내고 all-to-all로 통신하는 Mixture of Experts 기록입니다. 1 note batching 여러 요청을 한 번의 forward로 묶는 배칭 전략의 기록입니다. 2 notes flash-attention GPU 메모리 왕복을 줄여 어텐션을 빠르게 하는 Flash Attention 기록입니다. 2 notes fastapi FastAPI로 추론 API를 세우고 의존성 주입과 검증을 붙인 기록입니다. 1 note multiprocessing GPU 연산을 별도 프로세스로 떼고 큐로 통신하는 구조의 기록입니다. 1 note gpu GPU 메모리 점유와 유휴 시간을 실제 수치로 따져본 기록입니다. 1 note throughput 동시 요청 수를 올려가며 처리량과 지연을 실측한 기록입니다. 1 note streaming 생성된 토큰을 기다리지 않고 바로 흘려보내는 스트리밍 기록입니다. 1 note sse Server-Sent Events로 토큰을 요청별로 갈라 보내는 구조의 기록입니다. 1 note multi-model-serving 한 서비스가 여러 모델을 공유 자원에서 나눠 서빙하는 구조의 기록입니다. 1 note triton NVIDIA Triton Inference Server에 모델 로딩과 추론을 위임한 기록입니다. 1 note lru-cache 무엇을 메모리에 남길지 정하는 LRU 축출 정책의 기록입니다. 1 note transformer 어텐션으로 굴러가는 트랜스포머 아키텍처의 구조와 동작 기록입니다. 3 notes embedding 텍스트를 벡터로 바꾸는 임베딩과 그 벡터 공간에 관한 기록입니다. 1 note tokenization 입력 텍스트를 토큰으로 나누고 ID를 매기는 과정의 기록입니다. 1 note gpt-2 GPT-2 small을 기준으로 모델 내부를 뜯어본 기록입니다. 4 notes attention 토큰들이 서로를 참조해 맥락을 만드는 어텐션 연산의 기록입니다. 1 note self-attention 쿼리와 키가 같은 문장에서 나오는 셀프 어텐션의 기록입니다. 1 note mlp 어텐션 뒤에서 토큰을 하나씩 다듬는 MLP 층의 기록입니다. 1 note softmax 점수를 확률로 바꾸는 Softmax와 샘플링 전략의 기록입니다. 1 note