Default

LLM 백엔드에서 “Celery + Redis 큐 워커”를 2026년식으로 다시 설계하기: 비동기 처리, 중복 실행, 가시성(visibility)까지

· Backend / Architecture

LLM 기능을 서비스에 붙이면 요청 처리 시간이 갑자기 “수십 ms”에서 “수 초~수십 초”로 늘어납니다. 문제는 평균 지연이 아니라 꼬리 지연(tail latency) 과 외부 의존성(OpenAI/사내 inference/벡터DB/S3) 변동성이고, 이게 웹 API 스레드/프로세스를 잠…