KV Cache
모델이 이전 토큰의 계산 결과를 저장해 재사용함으로써 추론 속도를 높이는 메모리 영역
용례
"글로벌 KV 캐시 footprint를 토큰당 890바이트로 줄여 DeepSeek-V4-Flash의 약 4분의 1 수준으로 낮춤"
모델이 이전 토큰의 계산 결과를 저장해 재사용함으로써 추론 속도를 높이는 메모리 영역
"글로벌 KV 캐시 footprint를 토큰당 890바이트로 줄여 DeepSeek-V4-Flash의 약 4분의 1 수준으로 낮춤"