2026.08.09 llm 트랜스포머 2편. 어텐션은 실제로 뭘 계산하나 셀프 어텐션이 Q와 K와 V를 만들고 내적하고 마스킹하고 Softmax를 거쳐 문맥 벡터를 만들기까지, 그리고 헤드를 12개로 쪼개는 이유 transformer attention self-attention gpt-2