vLLM으로 서빙하고 성능 벤치마킹하기

·
ssafy/AI Engineering
AI 실습의 마지막 단계다. 세 단계가 모델을 만드는 과정이었다면, 이번에는 만든 모델을 서비스에 올린다.서빙 엔진으로는 vLLM을 쓴다. 같은 모델이라도 요청을 어떻게 받아 처리하느냐에 따라 처리량이 크게 달라지는데, vLLM은 KV Cache를 블록 단위로 관리하고 요청을 알아서 배치로 묶는다. 이 글에서는 vLLM이 무엇을 다르게 하는지, 엔진에서 어떤 값을 설정했고 그 값들이 무슨 의미인지, 그리고 Transformers와 비교했을 때 성능이 어떻게 나왔는지를 정리한다. 01 KV Cache는 이전 계산을 다시 하지 않게 한다LLM은 이전 토큰들을 보고 다음 토큰을 만든다. 그래서 아무 장치가 없으면 토큰 하나를 만들 때마다 앞의 모든 토큰을 처음부터 다시 계산하게 된다.KV Cache: 과거 토..