TEAL+DOT

Articles

기술과 브랜드, 그 사이의 이야기들

Brief

다양한 엣지 디바이스 환경에서 대규모 언어 모델의 추론 지연 시간을 정확하게 예측하는 프레임워크를 제안하는 논문입니다. 모델 구조와 하드웨어 상태 등 복잡한 변수를 고려하여 실행 단계를 분리하는 방식을 적용했습니다. 효율적인 LLM 배포를 위한 최적의 모델 선택 과정에 기여할 것으로 기대됩니다.

3시간 전arXiv AI
모든 아티클 보기