NVIDIA, H100 GPU에서 대용량 언어 모델 추론을 가속화하는 TensorRT-LLM 오픈소스 공개 예정
TensorRT-LLM은 TensorRT의 딥 러닝 컴파일러, 최적화된 커널, 전처리 및 후처리, 다중 GPU/다중 노드 통신을 단순하고 오픈 소스인 Python API에서 제공
생산 환경에서 추론을 위한 LLM을 정의, 최적화, 실행할 수 있음
C++ 이나 CUDA에 대한 깊은 지식 없이도 LLM에 최고 성능과 사용자 정의 기능을 빠르게 제공할 수 있음
H100 기반으로 TensorRT-LLM을 적용하여 테스트 했을 때,
GTP-J-6B 는 추론 성능 8배 향상, TCO 5.3배 감소, 에너지 소비량 5.6배 감소
Llama2 70B 는 추론 성능 4.6배 향상, TCO 3배 감소, 에너지 소비량 3.2배 감소
현재 NVIDIA Developer Program을 통해 얼리 억세스가 가능하며, 몇주 내로 출시할 예정
엔비디아 개발자 프로그램 : https://developer.nvidia.com/developer-program

