taxonomy
분류
카테고리는 글의 큰 맥락을 하나만 고르고, 태그는 다시 찾을 때 쓸 키워드로 붙입니다. 글이 늘어나도 이 페이지에서 주제별 입구를 유지합니다.
1 category · 40 tags · 15 notes
categories
카테고리
tags
태그
llm-d
Kubernetes 위에서 vLLM 파드를 여러 개 두고 요청을 나눠 보내는 llm-d 라우터 기록입니다.
2 notes
envoy
요청 경로 한가운데 서서 L7을 이해하는 프록시 Envoy의 구조와 확장 지점 기록입니다.
1 note
ext-proc
Envoy가 요청 처리를 외부 gRPC 서버에 위임하는 External Processing 필터 기록입니다.
1 note
gateway-api
Kubernetes Gateway API와 추론 서빙용 확장인 Inference Extension 기록입니다.
1 note
kubernetes
Deployment와 Service로 모델 서버를 띄우고 요청을 분산시킨 기록입니다.
4 notes
trainium
AWS가 설계한 AI 가속기 Trainium 위에서 모델을 서빙해본 기록입니다.
1 note
neuron
Trainium과 Inferentia를 다루는 소프트웨어 스택 Neuron SDK의 기록입니다.
1 note
vllm
vLLM의 배칭·메모리 선점 동작을 직접 재보고 비교한 기록입니다.
4 notes
llm-serving
LLM을 실제로 서비스할 때의 메모리·지연·처리량을 다루는 기록입니다.
9 notes
awq
활성값 분포를 보고 중요한 가중치를 지키는 AWQ 4bit 양자화 기록입니다.
1 note
quantization
가중치를 낮은 비트로 압축해 메모리를 줄이고 그 대가를 재본 양자화 기록입니다.
1 note
kv-cache
이미 계산한 키와 값을 재사용해 생성을 빠르게 하는 KV Cache 기록입니다.
4 notes
benchmark
같은 조건을 통제하고 처리량과 지연을 실제로 재서 비교한 기록입니다.
1 note
prefix-caching
같은 프롬프트 앞부분을 이미 계산한 파드로 요청을 보내 재계산을 줄이는 기록입니다.
1 note
speculative-decoding
작은 초안 모델이 추측한 토큰을 큰 모델이 한 번에 검증해 생성을 빠르게 하는 추측 디코딩 기록입니다.
1 note
ring-attention
KV Cache를 여러 장치에 나눠 담고 블록을 링으로 돌려 긴 컨텍스트를 처리하는 Ring Attention 기록입니다.
1 note
long-context
컨텍스트가 길어질 때 늘어나는 KV Cache와 메모리 부담을 다루는 기록입니다.
1 note
parallelism
모델을 여러 GPU에 나눠 담고 GPU 간 통신 병목을 다루는 병렬화 기록입니다.
1 note
tensor-parallel
한 레이어의 가중치를 여러 GPU에 쪼개고 all-reduce로 합치는 Tensor Parallel 기록입니다.
1 note
pipeline-parallel
모델을 레이어 단위로 나눠 GPU에 파이프라인처럼 흘려보내는 Pipeline Parallel 기록입니다.
1 note
moe
토큰을 일부 전문가에게만 보내고 all-to-all로 통신하는 Mixture of Experts 기록입니다.
1 note
batching
여러 요청을 한 번의 forward로 묶는 배칭 전략의 기록입니다.
2 notes
flash-attention
GPU 메모리 왕복을 줄여 어텐션을 빠르게 하는 Flash Attention 기록입니다.
2 notes
fastapi
FastAPI로 추론 API를 세우고 의존성 주입과 검증을 붙인 기록입니다.
1 note
multiprocessing
GPU 연산을 별도 프로세스로 떼고 큐로 통신하는 구조의 기록입니다.
1 note
gpu
GPU 메모리 점유와 유휴 시간을 실제 수치로 따져본 기록입니다.
1 note
throughput
동시 요청 수를 올려가며 처리량과 지연을 실측한 기록입니다.
1 note
streaming
생성된 토큰을 기다리지 않고 바로 흘려보내는 스트리밍 기록입니다.
1 note
sse
Server-Sent Events로 토큰을 요청별로 갈라 보내는 구조의 기록입니다.
1 note
multi-model-serving
한 서비스가 여러 모델을 공유 자원에서 나눠 서빙하는 구조의 기록입니다.
1 note
triton
NVIDIA Triton Inference Server에 모델 로딩과 추론을 위임한 기록입니다.
1 note
lru-cache
무엇을 메모리에 남길지 정하는 LRU 축출 정책의 기록입니다.
1 note
transformer
어텐션으로 굴러가는 트랜스포머 아키텍처의 구조와 동작 기록입니다.
3 notes
embedding
텍스트를 벡터로 바꾸는 임베딩과 그 벡터 공간에 관한 기록입니다.
1 note
tokenization
입력 텍스트를 토큰으로 나누고 ID를 매기는 과정의 기록입니다.
1 note
gpt-2
GPT-2 small을 기준으로 모델 내부를 뜯어본 기록입니다.
4 notes
attention
토큰들이 서로를 참조해 맥락을 만드는 어텐션 연산의 기록입니다.
1 note
self-attention
쿼리와 키가 같은 문장에서 나오는 셀프 어텐션의 기록입니다.
1 note
mlp
어텐션 뒤에서 토큰을 하나씩 다듬는 MLP 층의 기록입니다.
1 note
softmax
점수를 확률로 바꾸는 Softmax와 샘플링 전략의 기록입니다.
1 note