|
논문명은 ‘Modality-Aware Expert Pruning for MoE-Based Multimodal Large Language Models’다.
이번 연구는 텍스트와 이미지 등 여러 형태의 정보를 함께 처리하는 멀티모달 AI에 맞춰 ‘전문가 프루닝(Expert Pruning)’ 기술을 고도화한 것이 특징이다.
전문가 25% 줄여도 성능 98% 유지
전문가 혼합(MoE·Mixture of Experts) 모델은 여러 전문가 모듈 가운데 입력에 필요한 일부만 선택해 연산하는 구조다.
실제 연산에는 일부 전문가만 참여하지만 전체 전문가 모듈을 GPU 메모리에 저장해야 해 모델 규모가 커질수록 메모리 부담이 커진다.
전문가 프루닝은 중요도가 상대적으로 낮은 전문가 모듈을 제거해 이 부담을 줄이는 기술이다.
노타의 성능 평가 결과 약 310억 파라미터 규모 멀티모달 모델에서 전문가 모듈의 25%를 제거했을 때 원본 모델 성능의 98%를 유지했다.
전문가 모듈을 절반인 50%까지 제거했을 때도 원본 성능의 91%를 유지했다.
GPU 메모리 사용량은 58GB에서 31GB로 약 47% 감소했다. 이에 따라 40GB 메모리를 갖춘 GPU 한 장에서도 해당 모델을 구동할 수 있는 수준을 확보했다.
텍스트·이미지 중요도 따로 평가
기존 언어모델용 프루닝 기술을 멀티모달 모델에 그대로 적용하면 이미지 이해에 필요한 전문가까지 제거돼 성능이 크게 떨어질 수 있다.
실제 연구에서도 차트 이해처럼 이미지 정보가 중요한 과제에서는 기존 방식 적용 시 성능 저하가 나타났다.
노타는 이를 해결하기 위해 텍스트와 이미지 각각에 대해 전문가 모듈의 중요도를 따로 평가했다.
텍스트 기준 중요도는 유지할 전문가를 고르는 데 활용하고, 이미지 기준 중요도는 제거할 전문가를 선정하는 데 활용해 두 능력을 균형 있게 보존하도록 설계했다.
또 각 모델 층에서 동일한 수의 전문가를 일괄 제거하는 대신 모델 전체 전문가를 비교해 중요도가 높은 층의 전문가가 우선 유지되도록 했다.
추가 학습 없이 한 번에 압축
추가 학습 없이 한 번의 압축 과정만으로 경량화할 수 있다는 점도 특징이다.
사용자가 전문가 제거 비율만 설정하면 적용할 수 있어 새로운 파운데이션 모델이 등장하더라도 별도의 재학습 없이 빠르게 대응할 수 있다.
노타는 이번 기술을 자사 AI 최적화 플랫폼 ‘넷츠프레소(NetsPresso)’에 반영해 멀티모달 및 MoE 모델 지원 범위를 확대할 계획이다.
텍스트 전용 대규모언어모델(LLM)뿐 아니라 이미지와 언어를 함께 처리하는 비전언어모델(VLM)까지 최적화 대상도 넓힌다.
향후에는 입력 정보별 전문가 중요도를 평가하는 원리를 영상과 음성 등 다른 멀티모달 영역으로 확장할 계획이다.
노타는 앞서 ‘키미 K3’와 ‘솔라 오픈 2’ 등 초거대 모델에도 전문가 프루닝을 적용해 최적화 경험을 축적했다.
올해에는 ICLR와 EMNLP, ICML에 이어 NeurIPS에서도 연구 성과를 인정받았다고 회사 측은 설명했다.
채명수 노타 대표는 “AI 모델이 텍스트 중심 LLM에서 이미지와 영상, 음성을 함께 이해하는 멀티모달 AI로 발전하면서 모델 규모와 GPU 메모리 부담도 빠르게 커지고 있다”며 “이번 연구는 모델 성능을 유지하면서 필요한 컴퓨팅 자원을 크게 줄일 수 있다는 점에서 실제 AI 인프라 운영 효율을 높이는 데 의미가 크다”고 말했다.





