[IT 동아] 유재윤 에너자이 CTO “엣지 AI는 양자화 넘어 풀스택 최적화 향할 것”
2026년 09월 24일
[IT동아 남시현 기자]
엣지 AI란 데이터를 스마트폰, 사물인터넷 센서, 자율주행차 등 현장의 장치에서 직접 AI로 처리하는 기술이다. 몇년 전만 해도 엣지AI는 성능의 한계가 분명해 카메라 객체 인식, 음성 인식, 노이즈 제거 등 가벼운 수준의 모델을 운용하는 수준이었지만 최근에는 모델 양자화 기법이 기본으로 자리잡으면서 엣지 AI 기기에서도 소형언어모델(sLLM)을 운용하는 방식이 주목받고 있다. LLM을 탑재하면서 정해진 기능을 수행하는 기기에서 상황을 이해하고 판단해 여러 기능을 응용하는 기기로 발전한 것이다.
![[IT 동아] 유재윤 에너자이 CTO “엣지 AI는 양자화 넘어 풀스택 최적화 향할 것” 1
유재윤 에너자이 최고기술책임자 / 출처=IT동아](https://it.donga.com/media/__sized__/images/2026/9/24/d5e8b67b00b94f76-thumbnail-1920x1080-70.jpg)
이에 엣지AI용 모델양자화 기법을 개발하는 기업들도 움직임도 분주하다. 이들 기업은 AI 모델 개발사나 반도체 개발 기업과 달리 이미 만들어진 모델과 제품을 기반으로 모델을 재구성하고 축약하는 작업을 하므로 일반인들이 접할 일은 많지않다. 하지만 AI 모델 기업들은 자사 AI를 더 많은 곳에 확산시킬 목적으로, AI 반도체 기업은 제품에서 더 많은 연산과 성능을 집약하기 위해 모델양자화 기술 기업을 찾고 있다. 현장의 목소리를 들어보고자 엣지 AI 소프트웨어 및 모델 양자화 기술을 개발 중인 ‘에너자이’를 찾았다.
엣지AI, 양자화 넘어 컴파일, 런타임, 경량화와 최적화 모두 필요
유재윤 에너자이 최고기술책임자(CTO)는 서울대학교 전기·정보공학부에서 박사 학위를 수료했으며, AI 및 딥러닝, 기계학습 분야를 연구하는 윤성로 서울대 교수의 AI 랩 출신이다. 유재윤 CTO는 “당초 창업에 대한 생각은 없었지만 다른 연구실 소속 동료가 창업을 제안하면서 창업에 대한 생각을 갖게 됐고, 이후에 연구보다는 산업쪽으로 도전해보겠다는 생각이 앞서 장한힘 대표와 함께 에너자이를 창업했다”라며 창업 동기를 설명했다.
에너자이 역시 창업 초기에는 에너지 산업용 AI 기술로 시작했으며, 이후 이 과정에서 확보한 엣지 AI 기술을 다양한 산업에 범용적으로 적용하는 방향으로 사업의 중심축을 전환했다. 그사이 엣지AI가 단순 센서나 마이크로컨트롤러에서 범용 AI 장치까지 고도화되면서 에너자이의 사업도 AI 모델 양자화는 물론 컴파일러, 커널 최적화, 런타임 등 소프트웨어 전반을 다루는 풀스택 엣지 AI 기업으로 진화했다. 다만 이 ‘풀스택’의 범위가 회사마다 다른데, 에너자이의 경우는 어떤지 질문했다.
![[IT 동아] 유재윤 에너자이 CTO “엣지 AI는 양자화 넘어 풀스택 최적화 향할 것” 2
에너자이는 엣지 AI용 모델 양자화는 물론 관련 기술 전반을 다루는 풀스택 엣지 AI 기업이다 / 출처=IT동아](https://it.donga.com/media/__sized__/images/2026/9/24/8934caa92a7c4e2a-thumbnail-1920x1080-70.jpg)
유재윤 CTO는 “에너자이가 말하는 풀스택 엣지 AI는 AI 모델 개발부터 실제 온디바이스 환경에서의 실행까지 전 과정을 아우른다. 고객이 원하는 AI 기능을 정하면 모델 아키텍처 선정과 학습 데이터 구성 단계부터 함께 참여하고, 목표 기기의 메모리 용량과 연산 성능, 소비전력, 응답속도 등을 고려해 모델의 규모와 구조를 결정한다”라면서 “같은 프로세서를 탑재한 기기라도 수행하는 작업에 따라 AI에 할당할 수 있는 컴퓨팅 자원이 달라진다. 실제 사용 환경까지 고려해 커널과 컴파일러를 최적화하고, 최종적으로는 모델을 실행할 런타임과 고객 애플리케이션에서 활용할 인터페이스까지 제공하는 것이 에너자이가 정의하는 풀스택”이라고 설명했다.
에너자이는 엣지 AI를 다양한 하드웨어를 지원하는 범용성보다, 제한된 하드웨어 자원과 구동 환경에서 AI 성능을 얼마나 극대화할 수 있는지가 중요한 분야로 바라본다. 이에 에너자이는 폭넓은 하드웨어 지원보다는 목표로 하는 특정 하드웨어와 실제 구동 조건을 깊이 파고들어 성능을 극대화하는 데 집중한다.
하나의 개발 환경으로 최대한 다양한 하드웨어에 대응하기보다는 목표로 삼은 프로세서와 실제 구동 조건을 깊이 파고들어 성능을 극한까지 끌어올리는 방식이다. 모델 압축에 집중하거나 컴파일러·개발도구만 제공하는 기업과 달리 모델 개발과 경량화부터 커널, 하드웨어 최적화, 컴파일러, 런타임까지 연결한다는 점을 차별점으로 내세운다.
메모리 확보 중요해지며 ‘극한의 최적화’ 전략 유효해져
최근에는 생성형 AI가 엣지 기기로 확산하면서 메모리 효율의 중요성이 커지고 있다는 게 유 CTO의 설명이다. 그는 “LLM은 메모리 사용량과 대역폭이 실행 속도에 직접적인 영향을 미치기 때문에 업계 전반이 메모리 효율과 성능을 동시에 확보하는 데 집중하고 있다”라면서 “성능 저하를 최소화하면서 모델을 더욱 작게 만들기 위해 1.58비트 양자화에 도전했다. 학계와 업계에서 초저비트 양자화에 대한 다양한 연구가 이뤄지고 있지만, 이를 실제 엣지 기기에서 효율적으로 구동하기 위해서는 모델을 낮은 비트로 양자화하는 것만으로는 충분하지 않다.
![[IT 동아] 유재윤 에너자이 CTO “엣지 AI는 양자화 넘어 풀스택 최적화 향할 것” 3
에너자이는 미국 시냅틱스와 긴밀한 관계를 가져가며 엣지 AI 분야에서 협업 중이다 / 출처=시냅틱스](https://it.donga.com/media/__sized__/images/2026/9/24/ee064e97f4ad4e6d-thumbnail-1920x1080-70.jpg)
이 같은 극한의 최적화 전략은 NPU로 영역을 넓히면서 글로벌 반도체 기업과의 협력으로도 이어지고 있다. 유 CTO는 “CPU는 공개된 명령어 체계와 개발 환경을 활용해 칩 회사의 도움 없이도 상당 부분 최적화할 수 있지만, NPU는 제조사별 구조가 다르고 공개된 정보도 제한적이다”라면서 “우선 공개된 정보만으로 가능한 수준까지 직접 분석하고 최적화해 성능을 보여준 뒤 추가적인 기술 정보를 요청한다. 그렇게 성능을 입증하면 칩 회사에서도 관심을 갖고 기술 지원과 정보 교류가 시작되고, 더 깊은 수준의 최적화로 이어진다”라고 말했다.
에너자이는 이런 방식을 통해 시냅틱스와 브로드컴 등 주요 엣지 AI 반도체 기업과 관계를 텄으며, NXP, 퀄컴, 미디어텍, 어드밴텍 등과도 협업 관계에 있다. 시냅틱스는 과거 노트북 터치패드와 지문인식 칩 업체로 잘 알려졌지만, 현재는 사물인터넷과 엣지 AI용 프로세서, 센서용 반도체 등을 주력으로 하는 기업이다. 에너자이는 현재 시냅틱스와 밀도 높은 정기 기술 미팅을 진행하고 있으며, 공동 마케팅과 고객 발굴을 넘어 시냅틱스의 엣지 AI 소프트웨어 스택인 토크(Torq)의 컴파일러 개발 및 고도화까지 협업 범위를 넓히고 있다.
![[IT 동아] 유재윤 에너자이 CTO “엣지 AI는 양자화 넘어 풀스택 최적화 향할 것” 4
유재윤 CTO가 브로드컴 기반 장치에서 온디바이스 AI로 음성 인식 기능이 동작하는 모습을 소개 중이다 / 출처=IT동아](https://it.donga.com/media/__sized__/images/2026/9/24/da5bce5392f84b66-thumbnail-1920x1080-70.jpg)
브로드컴과의 관계도 비슷한 방식으로 시작됐다. 기존에 브로드컴이 공개한 SDK를 기반으로 자체 최적화를 진행해 기존 환경보다 높은 성능을 구현했고, 이를 브로드컴 측에 공유하면서 기술 협력이 본격화됐다. 유재윤 CTO에 따르면 반도체 업체 입장에서도 외부 업체가 자사 칩의 성능을 예상 이상으로 끌어올린 사례가 확인되면 보다 구체적인 기술 정보를 제공하고 추가적인 고도화를 요청하는 방식으로 협력 수준이 깊어진다.
현재 브로드컴과는 극저비트 모델을 NPU에서 구동하기 위한 세부 기술 정보까지 공유하며 최적화를 진행 중이다. 지난 9월 네덜란드 암스테르담에서 개최된 글로벌 주요 방송·통신 전시회 IBC에서는 다양한 제조사의 브로드컴 기반 셋톱박스에 에너자이의 AI 에이전트 모델을 탑재한 데모를 선보였다. 이외에도 에너자이는 음성 기반 명령 제어 모델을 LG유플러스 셋톱박스 300만 대에 배포했으며, 최근에는 해외 통신사업자들과 셋톱박스에 음성 번역과 셀프헬프 등의 AI 에이전트 기능을 탑재하는 프로젝트도 진행 중이다.
시장성은 1.58비트가 최적, 자체 프로그래밍 언어로 기술 고도화 中
에너자이를 가장 잘 설명하는 기술 용어가 1.58비트 양자화다. 최근 LLM은 학습 단계부터 16비트로 제작하며 사후 학습 양자화 방식으로 8비트나 4비트 등의 더 낮은 비트로 낮춰 성능은 최대한 유지하되 자원과 메모리 요구량은 줄인다. 에너자이는 양자화 인식 학습 방식을 통해 1.58비트의 더 낮은 비트로 가공하며, 여기서 끝내지 않고 CPU와 NPU 등이 해당 연산을 직접 지원해 성능을 확보할 수 있도록 자체 추론 엔진인 옵티미엄과 메타프로그래밍 언어 나디야를 활용해 1.58비트 전용 연산 커널을 구현한다.
![[IT 동아] 유재윤 에너자이 CTO “엣지 AI는 양자화 넘어 풀스택 최적화 향할 것” 5
에너자이는 퀄컴 IoT 칩 헥사곤 NPU에서 자체 추론 엔진 옵티미엄(Optimium)을 활용해 큐웬 3 1.7B를 1.58비트로 양자화한 모델을 구동하는 데 성공했다. 같은 모델을 더 적은 하드웨어 자원으로 구동하거나, 동일한 하드웨어에서 더 높은 성능의 AI를 구현할 수 있다는 것이 에너자이 기술의 핵심 가치다 / 출처=에너자이](https://it.donga.com/media/__sized__/images/2026/9/24/6e2517a8f28f4b76-thumbnail-1920x1080-70.jpg)
한편 올해들어 학계에서는 1.58비트를 넘어 1.25비트 양자화까지 거론되고 있는데 유재윤 CTO의 생각은 어떨까. 유재윤 CTO가 바라보는 1.58비트 양자화의 가치는 단순히 모델 용량을 줄이는 것보다 제한된 메모리 안에서 더 큰 모델을 구동할 수 있다는 점이 핵심이다. 가령 특정 기기에서 4비트 양자화를 적용한 10억 개 매개변수 모델을 구동할 수 있다면, 동일한 메모리 조건에서 1.58비트 양자화로는 이론적으로 약 25억 개 매개변수 규모의 모델까지 시도해볼 수 있다. 개별 연산의 정밀도가 다소 낮아지더라도 더 많은 매개변수와 데이터를 활용함으로써 최종 모델 성능이 오히려 높아지는 최적점을 찾는 것이 에너자이가 추구하는 방향이다.
![[IT 동아] 유재윤 에너자이 CTO “엣지 AI는 양자화 넘어 풀스택 최적화 향할 것” 6
에너자이의 자체 최적화 엔진인 옵티미엄이 AI 모델을 실제 하드웨어에 맞춰 최적화하는 파이프라인 / 출처=에너자이](https://it.donga.com/media/__sized__/images/2026/9/24/93944ce3fa744bdd-thumbnail-1920x1080-70.jpg)
극한의 최적화 전략은 자체 메타프로그래밍 언어 ‘나디야(Nadya)’ 개발로 이어졌다. 업계에는 엔비디아 CUDA를 비롯해 오픈AI 트리톤(Triton), 구글 XLA·IREE 등 강력한 컴파일러 및 커널 생태계가 존재하지만 이 기술로 에너자이가 원하는 수준의 최적화를 구현하기에는 한계가 있다는 판단이다. 유재윤 CTO는 “엔비디아 쿠다, 오픈AI 트리톤 등은 하이퍼스케일 환경과 GPU 대상이다. 우리는 엣지 환경에서 극단적인 수준의 최적화가 필요했고, 텐서플로 라이트 포 마이크로컨트롤러나 오닉스 런타임 등 기존 선택지로도 부족했다. 컴파일러를 매번 만들기 보다는 아예 프로그래밍 언어를 만드는 것이 더 효율적이었다”라고 말했다.
빠르게 진화하는 오픈소스 컴파일러 생태계 대응도 중요 과제다. 에너자이는 AI 컴파일러의 중간 표현(IR) 계층으로 널리 쓰이는 MLIR을 활용하고 있는데, MLIR은 개발 속도가 빠른 만큼 API 변경이 잦아 버전 업데이트에 따른 유지보수 부담이 큰 편이다. 인력이 부족한 스타트업 입장에서 어떻게 대응하고 있을까.
유재윤 CTO는 “다양한 하드웨어 플랫폼과 런타임을 다루어 본 역량은 단기간에 확보하기 어려운 기술”이라며 “오랜 기간 여러 플랫폼과 런타임을 직접 다루면서 각 환경의 특성과 발생할 수 있는 문제, 이에 대한 대응 방식에 대한 경험과 노하우를 축적해왔다. 이러한 축적된 엔지니어링 역량이 새로운 플랫폼과 환경 변화에 빠르게 대응할 수 있는 기반이자 중요한 기술적 진입장벽”이라고 말했다.
“빠르면 2년 내 모든 칩 제조사에 커널링 모델 만들고파”
에너자이의 기술 협업은 지금 실제 현장에서 더 빛을 발하고 있다. 에너자이는 퀄컴의 AI 이노베이터 프로그램(QAIPI) 2026 선정을 바탕으로 오는 10월 21일 개최되는 ‘2026 산업AI EXPO’에 참가할 예정이며, 자체 부스와 함께 퀄컴 공동관에서도 온디바이스 AI 에이전트 모델 데모를 시연할 계획이다.
해외에서는 시냅틱스와의 정기 기술 미팅과 토크(Torq) 컴파일러 개발·고도화를 발판 삼아, 작년에 이어 올해도 시냅틱스 테크데이에서 시냅틱스 칩에 최적화한 스마트홈용 온디바이스 AI 에이전트를 시연한다. 브로드컴과는 IBC 2026에 이어, 10월 오스트리아 비엔나에서 개최되는 네트워크X 2026에서도 브로드컴 칩 기반 브로드밴드 게이트웨이 온디바이스 AI 모델을 시연할 예정이다.
![[IT 동아] 유재윤 에너자이 CTO “엣지 AI는 양자화 넘어 풀스택 최적화 향할 것” 7
유재윤 CTO는 가능한 많은 제조사가 에너자이의 기술에 관심을 가지기를 희망한다 / 출처=IT동아](https://it.donga.com/media/__sized__/images/2026/9/24/a64918fb187740c3-thumbnail-1920x1080-70.jpg)
유재윤 CTO는 향후 2년 안에 에너자이의 커널 및 컴파일러 기술을 최대한 많은 제조사로 확장하는 것을 목표로 잡았다. 유재윤 CTO는 “단기적으로 2년 정도를 목표로 모든 칩 제조사, NPU 제조사에 우리가 손본 커널링 모델을 적용하고 싶다”라면서 “옵티미엄을 새로운 하드웨어에 빠르고 가볍게 확장할 수 있도록 만들고, 1.58비트 학습 기법 역시 원본 모델의 성능에 최대한 가깝게 끌어올리는 것이 목표”라고 말했다.
이제 엣지 AI 시장은 이제 단순히 모델을 작게 만드는 경쟁을 넘어, 제한된 하드웨어에서 얼마나 큰 모델을 얼마나 효율적으로 구동하느냐의 경쟁으로 옮겨가고 있다. 에너자이는 모델 양자화와 커널, 컴파일러, 런타임을 아우르는 최적화 기술을 앞세워 이 시장에서 입지를 넓힌다는 계획이다. 그리고 이미 글로벌 기업들이 이들을 찾아오는 만큼 2년 안에 모든 칩을 접해본다는 이들의 계획도 실현 가능성이 높아보였다.
IT동아 남시현 기자 (sh@itdonga.com)
<구체적인 내용이나 첨부파일은 아래 [IT 동아] 사이트의 글에서 확인하시기 바랍니다.>