
생성형 인공지능(AI)의 성능 경쟁은 오랫동안 모델의 파라미터와 GPU 연산 자원을 확대하는 방향으로 진행돼 왔다. 높은 성능을 확보하기 위해 대규모 서버와 GPU 인프라를 구축하는 방식이다. 반면 기업 내부에서 사용하는 AI는 성능뿐 아니라 구축 비용과 데이터 관리, 운영 환경까지 함께 고려해야 한다.
보안 및 AI 기술을 개발하는 에코마치에서 기술이사를 맡고 있는 민현준 개발자는 이와 다른 방향에서 기업용 AI의 가능성을 연구하고 있다. 그가 개발 중인 ‘디지털 뉴런(Digital Neuron)’은 모델 자체의 규모를 확대하기보다 필요한 지식을 선별해 활용하고, 생성 과정에서 복수의 추론 경로를 운용하는 구조를 지향한다.
민 기술이사는 “기업에서 AI를 실제 업무에 적용하려면 모델의 크기만큼 중요한 것이 필요한 지식을 얼마나 효율적으로 불러오고 검증할 수 있느냐는 점”이라며 “디지털 뉴런은 제한된 하드웨어에서도 업무에 필요한 AI 기능을 운용할 수 있는 구조를 만드는 데 초점을 두고 있다”고 설명했다.
“모든 지식을 항상 활성화할 필요는 없다”
민 기술이사가 설명하는 디지털 뉴런의 핵심 가운데 하나는 메모리 기반의 지식 운용 방식이다.
개발자 측에 따르면 디지털 뉴런은 약 7B급 경량 코어를 기반으로 대규모 지식 데이터를 저장 영역과 실제 추론 과정에서 사용하는 활성 영역으로 구분한다. 모든 정보를 한꺼번에 활성화하기보다 작업에 필요한 정보를 선택적으로 불러오는 방식이다.
민 기술이사는 이를 ‘지식 밀도’의 문제라고 설명한다. 모델의 물리적인 규모를 계속 확대하는 것보다 제한된 연산 자원에서 필요한 지식을 얼마나 효율적으로 활용하느냐가 로컬 AI에서는 중요하다는 것이다.
다만 개발자 측이 제시한 ‘80B급 지식 활용’은 일반적인 AI 모델의 파라미터 수가 80B라는 의미와는 구분할 필요가 있다. 디지털 뉴런의 코어 자체가 80B 파라미터 모델이라는 뜻이 아니라, 개발 과정에서 구축한 지식 운용 규모를 설명하기 위해 사용한 표현이다. 향후 동일한 조건의 공개 벤치마크 등을 통한 비교 검증이 필요한 부분이기도 하다.
두 개의 추론 경로로 생성과 검증 병행
또 다른 특징은 민 기술이사가 ‘이중 동시 추론(Dual Simultaneous Inference)’이라고 명명한 구조다.
한쪽 추론 경로에서 답변을 생성하는 동안 다른 경로에서 사실관계와 논리적 일관성을 확인하도록 설계했다는 설명이다. 답변 생성 이후 별도의 필터를 적용하는 방식보다 추론 과정에서 교차 확인하는 구조에 가깝다.
이 같은 설계는 기업 환경에서 요구되는 코드 수정이나 내부 문서 검색, 정보 추출 등의 업무를 염두에 둔 것이다.
예를 들어 코딩 업무에서는 새로운 코드를 작성하는 것뿐 아니라 기존 코드베이스의 구조와 앞서 작성된 내용을 유지하면서 오류를 수정하거나 기능을 추가해야 한다. 문서 검색 역시 관련 자료를 찾아내는 것과 해당 자료를 근거로 일관된 답변을 만드는 것은 별개의 문제다.
민 기술이사는 이 과정에서 생성과 검증을 병행하도록 설계해 결과물의 오류 가능성을 줄이는 방향으로 개발하고 있다고 설명했다. 실제 환각 감소 정도와 정확도 향상 수준은 향후 동일한 데이터셋과 비교 모델을 적용한 외부 평가가 이뤄져야 객관적인 판단이 가능하다.
고성능 GPU 대신 일반 PC급 하드웨어에서 테스트
디지털 뉴런 개발에서 눈에 띄는 부분은 테스트에 사용한 하드웨어다.
민 기술이사에 따르면 현재 개발 버전은 AMD 라이젠 5 4600G 프로세서와 32GB 메모리를 탑재한 환경에서도 구동할 수 있도록 설계됐다. 개발자 자체 테스트에서는 조건에 따라 초당 약 36토큰의 생성 속도를 기록했다고 한다.
전력 소비 역시 개발자 측 측정 기준 풀로드 상태에서 약 65~80W 수준이다. 동시에 사용하는 인원은 업무 유형과 요청량에 따라 차이가 있지만 2~4명 규모의 소규모 환경을 우선적인 적용 대상으로 보고 있다.
이는 대규모 AI 서버를 대체하기 위한 접근이라기보다 사내 부서나 사업장, 지점 등에 독립적으로 설치할 수 있는 소형 AI 노드를 염두에 둔 설계다.
특히 기업 내부에서 처리해야 하는 문서나 코드 등 외부 전송에 신중해야 하는 데이터를 로컬 환경에서 다룰 수 있다는 점은 향후 활용 가능성을 검토할 수 있는 대목이다. 다만 실제 보안 수준은 시스템 구성, 네트워크 정책, 접근통제 방식 등에 따라 달라지는 만큼 로컬 구동 자체가 보안성을 보장하는 것은 아니다.
10M 토큰 장문 처리 목표…실무 적용 검증이 관건
장문 컨텍스트 처리도 개발 과정에서 비중 있게 다루고 있다.
민 기술이사는 메모리 압축과 선택적 로딩 구조를 활용해 최대 10M 토큰 규모의 컨텍스트를 다루는 것을 목표로 개발하고 있다고 밝혔다. 대량의 사내 문서나 프로젝트 자료, 코드베이스 등을 장기간 유지하면서 작업하는 환경을 염두에 둔 것이다.
다만 최대 입력 가능 토큰 수와 실제로 해당 범위 전체에서 정보를 정확하게 검색·회수하고 추론하는 능력은 구분해서 살펴볼 필요가 있다. 초장문 컨텍스트 환경에서는 특정 정보를 얼마나 정확하게 찾아내는지, 문맥 간 관계를 어느 수준까지 유지하는지 등에 대한 별도의 성능 검증이 요구된다.
민 기술이사 역시 디지털 뉴런의 방향을 고성능 AI 인프라의 전면적인 대체보다는 역할 분담에 두고 있다.
라이젠 5 4600G와 같은 일반 PC급 환경은 대규모 동시 요청이나 고부하 연산, 이미지·영상 등 멀티모달 처리에서는 고성능 GPU 서버와 비교해 물리적인 한계가 있기 때문이다.
이에 따라 내부 문서 검색과 요약, 코드 보조, 반복적인 텍스트 업무 등은 로컬 AI가 처리하고 대규모 연산이 필요한 작업은 별도 GPU 인프라나 클라우드 시스템을 활용하는 형태의 하이브리드 구성이 현실적인 적용 모델로 거론된다.
“저사양에서도 필요한 일을 하는 AI가 목표”
민 기술이사가 디지털 뉴런을 통해 확인하려는 것은 최고 사양의 하드웨어에서 최고 성능을 내는 방법과는 방향이 다르다. 기업이 이미 보유하고 있거나 비교적 쉽게 구축할 수 있는 장비에서 어느 수준까지 AI 업무를 처리할 수 있는지를 검증하는 것이 개발의 주요 과제다.
특히 AI를 자체적으로 운영하려는 기업 입장에서는 GPU 구매 비용과 전력, 서버 운영뿐 아니라 내부 데이터의 외부 전송 여부까지 도입 과정에서 함께 검토해야 한다. 로컬 AI가 이러한 문제의 모든 해답이 될 수는 없지만 업무 특성에 따라 선택할 수 있는 하나의 인프라 구조가 될 수 있다는 것이 민 기술이사의 설명이다.
현재 디지털 뉴런의 주요 성능 수치는 개발자 측 자체 테스트를 기반으로 하고 있어 향후 공개된 평가 방법과 독립적인 검증을 통해 재현성을 확인하는 과정이 남아 있다. 실제 기업 환경에서 장기간 운용했을 때의 안정성, 동시 사용자 증가에 따른 성능 변화, 장문 컨텍스트의 정확도 등도 확인해야 할 부분이다.
민 기술이사는 “고성능 하드웨어가 필요한 영역은 분명히 존재한다. 우리가 보고 있는 것은 모든 AI 업무가 반드시 같은 수준의 하드웨어를 요구하는가 하는 문제”라며 “필요한 지식을 효율적으로 관리하고 추론 과정에서 검증할 수 있다면 기존 장비에서도 처리할 수 있는 업무 영역을 넓힐 수 있다고 보고 개발을 이어가고 있다”고 말했다.
결국 디지털 뉴런의 성패를 가를 기준은 모델 규모에 대한 수치 자체보다 실제 기업 환경에서 어느 정도의 정확도와 속도, 안정성을 반복적으로 구현할 수 있느냐에 있다. 개발자 자체 테스트에서 출발한 기술이 객관적인 벤치마크와 현장 적용을 거쳐 어느 수준까지 재현될 수 있을지가 다음 검증 단계다.
