INSIGHT
News/PR
LabQ의 새로운 소식과 언론보도를 전해드립니다.
[PRESS] LABQ InferQ·BoostQ로 구현하는 AI 인프라 최적화
-
관
관리자
- 26.07.16
543
AI 서비스가 확대되면서 LLM 운영 환경에서는 더 높은 처리량과 빠른 응답속도, 그리고 효율적인 GPU 활용이 중요한 과제가 되고 있습니다.
LABQ는 이러한 문제를 해결하기 위해 추론 최적화 소프트웨어 'InferQ'와 FPGA 기반 RAG 검색 가속 솔루션 'BoostQ'를 제공합니다.
InferQ는 KV Cache 최적화 기술을 적용하여 GPU 메모리 사용량을 줄이고 동일한 GPU 환경에서도 더 많은 동시 사용자를 처리할 수 있도록 지원합니다. 또한 vLLM과 호환되는 구조를 제공하여 기존 운영 환경에도 손쉽게 적용할 수 있습니다. 이를 통해 GPU 증설 이전에도 인프라 투자 비용(CAPEX)을 절감하고 운영 효율을 높일 수 있습니다.
BoostQ는 RAG 검색과 리랭킹 작업을 FPGA에서 처리하여 GPU가 토큰 생성에 집중할 수 있도록 지원합니다. 검색 지연 시간을 단축하고 GPU 부하를 줄여 응답 속도와 시스템 효율을 함께 향상시키며, 망분리 환경에서도 안정적인 AI 서비스를 구현할 수 있습니다.
LABQ의 추론 최적화 풀스택은 국방, 공공, 금융, 의료 등 다양한 산업의 AI 인프라 환경에 적용 가능하며, 고객 워크로드 기반 PoC를 통해 성능을 검증한 후 최적의 구축 방안을 제공합니다. 목표 성능 기준으로는 동일한 서비스 수준에서 GPU 소요량 절감, RAG 검색 지연 감소, 추론 인프라 TCO 절감 효과를 기대할 수 있습니다.
- 이전글expand_less
- 다음글expand_more
- 포스코이앤씨와 함께하는 LLM 기반 하자예방 기술추천 시스템 구축