이 누리집은 대한민국 공식 전자정부 누리집입니다.

독파모 오픈모델의 다음 경쟁력은 생태계다

2026.09.29

[기고] 독파모 오픈모델의 다음 경쟁력은 생태계다

업스테이지·LG AI연구원·SK텔레콤 모델의 공개 이후를 추적하다

 

- 한국전자통신연구원 선임연구원 박찬성 -

 

업스테이지 Solar Open 2 / LG AI연구원 K-EXAONE 2.0 / SK텔레콤 A.X K2

독자 AI 파운데이션 모델 사업은 국가의 핵심 기술 기반이 될 AI를 직접 개발하고 활용할 역량을 확보하는 사업이다. 기술을 고르고 자체 환경에서 운영하며 목적에 맞게 개선하는 능력까지 소버린 AI의 범위에 들어간다. 2026년 8월 18일 2차 평가를 거친 업스테이지·LG AI연구원·SK텔레콤의 공개 모델은 그 능력을 개발사 밖의 연구자와 기업, 개인 개발자에게 넓혔다. 가중치가 연구와 제품, 새로운 모델의 재료로 쓰이기 시작할 때 독파모는 공동의 기술 기반이 된다.

 

이 글은 공개 뒤에 벌어진 일을 따라간다. 누가 모델을 다른 형식으로 바꾸고, 어떤 도구가 새 구조를 받아들였으며, 그 결과가 앱과 서비스에 어떻게 쓰였는지를 살폈다. 세 모델은 직접 실행하거나 추가 학습하는 데 상당한 연산 자원이 든다. 여러 GPU를 다루는 학습·추론 도구, 실행 부담을 낮추는 경량화 기술, 앱과 에이전트가 호출할 인터페이스가 중요한 이유다. 외부 개발자가 가중치를 실행하고 고쳐 다시 배포할 수 있어야 공개 모델의 경쟁력이 완성된다.

 

공개의 출발점은 라이선스다

오픈모델 생태계의 첫 조건은 이용자가 모델을 실행하고 수정하며 재배포할 수 있는 라이선스다. 여기서 재배포는 원본 가중치를 다른 형식으로 바꾸거나 추가 학습한 뒤, 그 결과물을 다시 공개하는 일까지 포함한다. 파일을 내려받을 수 있다는 사실만으로 상업적 서비스나 파생 모델의 배포까지 허용되는 것은 아니다. 성능과 실행 환경을 검토할 때 이용 조건을 함께 읽어야 하는 이유다.

 

K-EXAONE 2.0과 A.X K2는 상업적 이용과 수정·재배포를 허용하는 Apache 2.0으로 공개됐다. 기업이 내부 업무에 맞춰 모 델을 조정하거나 서비스에 활용할 수 있으며, 재배포할 때는 라이선스 사본 제공과 변경 사항 표시 등의 조건을 따른다. Solar Open 2는 Apache 2.0을 바탕으로 별도 조건을 더한 Upstage Solar License를 적용한다. 파생 모델을 배포·제공할 때 모델 이름을 ‘Solar’로 시작하고, 관련 웹사이트·사용자 화면·문서에 ‘Built with Solar’를 표시해야 한다. 세 모델 모두 상업적으로 활용할 수 있으며, 파생 모델의 이름과 출처 표시 조건에서 차이가 난다.

 

가중치가 생태계로 이어지는 세 경로

가중치를 내려받은 뒤에는 크게 세 갈래의 일이 벌어진다. 연구자는 성능을 재고 추가 학습을 하고, 운영자는 여러 GPU에 모델 을 올려 추론 서버를 만든다. 앱 개발자는 그 서버를 검색 서비스나 에이전트에 붙인다. 이 과정에서 쓰이는 라이브러리와 프레임워크가 오픈소스 모델 생태계다.

 

새 모델이 이런 도구에 들어갈 수 있는 까닭은 가중치와 함께 ‘읽는 법’도 공개되기 때문이다. 세 모델의 Hugging Face 저장소에는 모델 구조를 적은 설정 파일, 문장을 숫자로 바꾸는 토크나이저, 대화 순서를 정하는 템플릿이 함께 있다. AutoTokenizer 와 AutoModelForCausalLM은 저장소 주소를 보고 이 파일과 모델 구현을 찾아 불러오는 Transformers의 공통 입구다. 지원 단계는 본류 통합, 소스 설치, 개발사 분기가 섞여 있어 설치법까지 같지는 않다. 그래도 이 입구를 통과하면 평가·학습 도구는 익숙한 형태의 모델과 토크나이저를 받아 기존 작업 흐름의 상당 부분을 그대로 쓸 수 있다. vLLM이나 SGLang이 모델을 OpenAI 호환 API로 내놓으면 앱과 에이전트는 같은 형식으로 질문을 보내고 답을 받는다. 서버 주소와 모델별 응답 해석 방식만 맞추면 되는 것이다. 생태계를 움직이는 것은 ‘Transformers 지원’이라는 표시 하나보다 저장소 형식, 로더, 서빙 API가 맞물 리는 구조다.1

 

연구와 오픈 사이언스

공개 모델 연구는 평가, 후속 학습, 재평가의 순환으로 진행된다. 한국어 기술 문서에 대한 응답을 개선한다면 먼저 기준 질문으로 성능을 측정하고, 준비한 자료로 모델을 학습한 뒤 같은 조건에서 다시 평가한다. Transformers는 모델을 불러오고, Datasets는 학습 자료를 읽고 가공한다. PEFT와 TRL은 전체 가중치를 처음부터 다시 학습하지 않고도 목적에 맞게 모델을 조정하는 데 쓰인다. Axolotl과 LLaMA-Factory는 이런 도구의 옵션을 설정 파일로 묶어 같은 실험을 다시 실행하기 쉽게 만들고, Unsloth는 지원 모델의 메모리 사용량과 학습 시간을 줄이는 데 초점을 둔다. 어떤 도구를 선택하든 모델별 설정과 실행 기록 이 남아야 다음 연구자가 실험을 이어받는다.2

 

에이전트의 도구 사용 능력을 개선하려면 실제 작업 결과를 수집하고, 잘한 행동에 보상을 주는 방식으로 학습에 다시 반영해야 한다. verl과 OpenRLHF는 이런 강화학습 기반 후속 학습을 여러 GPU에서 나누어 처리한다. 한쪽에서는 모델이 답을 만들고 다른 쪽에서는 그 결과로 가중치를 갱신하므로, 모델 구조와 보상 방식, 도구 호출 형식을 함께 맞춰야 한다. K-EXAONE 2.0에는 Megatron-Bridge 지원이 공개돼 있다. Hugging Face 형식의 가중치를 대규모 분산 학습에 쓰는 Megatron 형식으로 옮길 수 있어 추가 학습의 출발점이 된다.3 검증된 모델별 학습 레시피가 쌓일수록 외부 연구의 진입 속도도 빨라진다.

 

평가는 후속 학습과 같은 무게를 갖는다. Language Model Evaluation Harness, LightEval, OpenCompass를 활용하면 한국어 지식, 긴 문서 처리, 도구 사용처럼 목표에 맞는 시험을 구성할 수 있다.4 학습 전후 모델에 같은 문항과 생성 조건을 적용해야 무엇이 실제로 나아졌는지 비교할 수 있다. 모델 버전과 문항, 프롬프트 형식, 추론 설정, 채점 방법까지 공개되면 다른 연구자도 같은 시험을 다시 돌려 점수를 검증할 수 있다. 그때 벤치마크 점수는 단순한 홍보 수치가 아니라 재사용 가능한 연구 결과가 된다.

 

세 모델의 기술 보고서를 읽으면 가중치 뒤의 연구 과정이 어디까지 공개됐는지 알 수 있다. 그림 1은 모델 구조, 학습 데이터, 학습 방법, 평가처럼 재현에 필요한 여덟 항목을 정리해 GLM과 DeepSeek 계열과 비교했다. 다섯 모델 모두 아키텍처는 비교적 상세히 설명하지만, 데이터의 구성 비율이나 학습률·배치 크기 같은 실행값, 평가에 사용한 코드와 환경은 공개 수준이 다르다. 국내 세 모델은 최종 가중치를 공개했지만 전체 학습 코드·데이터 목록·중간 체크포인트를 한데 묶은 재학습 패키지는 제공하지 않는다. 따라서 외부 연구자는 매트릭스에서 정보가 끊긴 지점부터 조건을 새로 정해 실험해야 한다.5

 

그림 1. 기술 보고서에서 확인되는 학습 재현 정보. ‘상세’는 핵심 수치와 절차가 설명된 항목, ‘미확인’은 선택한 보고서에서 실질 정보를 확인하지 못한 항목이다. †는 현행 보고서가 동일성을 명시한 범위에서 직전 공식 보고서의 설명을 반영했다. GLM 행은 GLM-5.3 모델 카드가 인용한 GLM-5 보고서를 기준으로 한다.

[그림 1] 기술 보고서에서 확인되는 학습 재현 정보. ‘상세’는 핵심 수치와 절차가 설명된 항목, ‘미확인’은 선택한 보고서에서 실질 정보를 확인하지 못한 항목이다. †는 현행 보고서가 동일성을 명시한 범위에서 직전 공식 보고서의 설명을 반영했다. GLM 행은 GLM-5.3 모델 카드가 인용한 GLM-5 보고서를 기준으로 한다.

 

 

추론과 서빙

세 모델은 모두 여러 ‘전문가’ 신경망 가운데 질문에 맞는 일부만 골라 계산하는 MoE 구조다. 매번 전체 매개변수를 계산하지 않아 추론량은 줄지만, 어떤 전문가가 선택될지 미리 알 수 없으므로 서빙할 때는 전체 가중치를 GPU 메모리에 올려야 한다. Solar Open 2는 총 2,500억 매개변수 중 토큰당 약 150억 개를 사용하고, K-EXAONE 2.0은 총 7,500억 개 중 약 370억 개, A.X K2는 총 6,880억 개 중 약 330억 개를 사용한다. 공개된 실행 예시는 Solar Open 2에 H200 또는 B200급 GPU 8장, K-EXAONE 2.0에 H200 16장, A.X K2의 FP8 가중치에 B300 4장을 배치한다.6 정밀도와 설정은 서로 다르지만 메시지는 분명하다. 원본 모델의 직접 서빙은 서버급 GPU 인프라에서 시작된다.

 

기업이 사내 기술 문서에 답하는 서비스를 만든다고 해보자. 가중치를 여러 GPU에 나누어 올리고 vLLM이나 SGLang으로 추론 서버를 띄운 다음, 앱은 API로 질문을 보낸다. vLLM과 SGLang은 모델 자체가 아니라 여러 사용자의 요청을 모아 효율적으 로 처리하는 서버 소프트웨어다. 어떤 요청을 함께 계산할지 정하고, 긴 입력과 답변이 차지하는 GPU 메모리를 관리한다. 세 모델 모두 vLLM으로 서빙하는 방법이 있고 K-EXAONE 2.0은 SGLang 방법도 제공한다.7 K-EXAONE 2.0 지원은 vLLM 본류에도 반영됐다. 전용 구현이 범용 프로젝트에 들어가면 별도 분기를 설치하고 유지하는 비용이 줄어든다.

 

양자화는 가중치의 숫자를 더 적은 비트로 저장해 장비 부담을 낮추는 방법이다. 파일과 메모리 사용량이 줄어드는 대신 방식에 따라 품질이나 속도가 달라질 수 있다. Solar Open 2와 K-EXAONE 2.0에는 이런 저정밀도 가중치가 공개돼 있고, A.X K2 는 FP8 가중치를 제공한다.8 전체 매개변수를 유지한 채 4비트로 단순 환산해도 가중치 크기는 각각 약 125GB, 375GB, 344GB이며 실제 실행에는 답변 문맥과 중간 계산을 담을 추가 메모리가 든다.9 온디바이스·엣지 실행과 개인 호스팅에는 소형 파생 모델이나 원격 추론 서버가 현실적인 선택이다. 가중치·엔진·GPU 구성·입력 길이를 함께 적은 배포 예시가 있어야 ‘실행 가능’이 구체적인 사용법이 된다.

 

애플리케이션과 에이전트 연결

추론 서버가 준비되면 공개 모델을 기존 앱에 연결할 수 있다. 기술 문서 서비스는 문서를 작은 단위로 나눠 검색용 목록을 만들고, 질문과 관련된 대목을 먼저 찾아 모델에 전달한다. 모델이 회사 문서를 모두 외울 필요 없이 필요한 문단을 그때그때 참고하게 하는 방식이다. LlamaIndex와 LangChain은 이 검색과 모델 호출의 흐름을 구성한다. 모델 서버가 널리 쓰이는 API 형식으로 응답하면 검색 부분을 유지한 채 여러 모델을 교체해 시험할 수 있다. 검색 정확도와 답변의 근거성, 동시 이용자의 응답 속도까지 관리하면 모델 호출은 제품 기능으로 완성된다.

 

에이전트는 모델이 검색, 파일 읽기, 외부 프로그램 실행 같은 도구를 고르고 그 결과를 받아 다음 행동을 정하는 애플리케이션이다. OpenClaw는 메시지와 이런 도구를 잇고, vLLM의 OpenAI 호환 API를 모델 공급자로 받는다.10 메신저의 질문을 받아 사 내 검색 도구를 호출하고 결과를 요약하는 앱도 같은 방식으로 만들 수 있다. 세 모델 모두 vLLM으로 서버를 띄울 수 있어 이 접점을 쓸 수 있다. 다만 모델마다 도구를 호출하겠다는 신호와 추론 결과를 표시하는 방식이 달라, 이를 해석하는 서버 설정이 실제 완성도를 좌우한다.

 

코딩 에이전트는 파일을 읽고 수정한 뒤 테스트 결과에 따라 다음 행동을 고른다. OpenCode·Cline·OpenHands·Codex CLI는 외부 모델 서버를 등록할 수 있다. Solar Open 2는 Hermes Agent와 Claude Code 예제를, K-EXAONE 2.0은 OpenCode 설정을 공개했다. A.X K2 문서에는 추론 결과와 도구 호출을 읽는 서버 설정이 있다.11 다만 Codex CLI의 Responses API와 Claude Code의 Anthropic 호환 인터페이스는 요청과 응답을 주고받는 규칙이 서로 다르다. 주소만 바꾸는 것으로 끝나지 않고, 모델별 응답을 읽는 파서와 여러 단계 작업을 직접 검증해야 안정적으로 쓸 수 있다.12

 

공개 가중치는 다양한 서비스에 연결할 수 있고, 목적에 맞게 양자화하거나 추가 학습해 다른 모델로 바꿔 쓸 수도 있다. 그러나 모델을 재현하는 문제를 넘어 제대로 활용하고 알맞게 튜닝하려면, 어떤 데이터와 학습 단계가 현재의 능력과 한계를 만들었는지 알아야 한다. 데이터 구성과 처리 방식, 학습 목표와 순서, 주요 설정과 평가 조건이 공개돼 있으면 개발자는 모델이 잘하는 일과 흔들리는 조건을 짐작하고 그에 맞는 학습·서빙 방법을 고를 수 있다. 기술을 결과만 나오는 블랙박스가 아니라 내부 원리와 선택을 검토할 수 있는 화이트박스로 다룰 때 외부 연구자는 결과를 검증하고, 개발자는 목적에 맞게 고치며, 그 개선을 다시 공동의 지식으로 돌려줄 수 있다. 이것이 오픈소스와 오픈 사이언스가 함께 작동하는 기본 토대다.

 

파생에서 실제 활용으로

공개 모델의 생태계는 관심, 이용, 후속 제작의 층으로 넓어진다. 그림 2는 세 모델과 GLM·DeepSeek 계열의 직전·최신 세대를 묶어 Hugging Face 좋아요, 누적 다운로드, 확인된 파생 저장소를 보여준다. 좋아요는 이용자가 관심 모델로 표시한 횟수에 가깝고, 다운로드는 특정 파일이 요청된 횟수다. 파생은 원본을 양자화하거나 추가 학습하는 등 새 결과물을 공개 저장소에 올린 경우를 센다. 공개 시점과 모델 크기, 허브 밖의 API 이용이 다른 만큼 세 지표는 하나의 순위가 아니라 서로 다른 활동의 단면으로 읽어야 한다.13

 

 

그림 2. Hugging Face에서 관측한 공개 모델의 활동 현황. 각 계열의 직전 세대와 최신 세대 두 저장소를 합산했다. 파생은 원본과의 직접 관계를 확인한 공개 저장소이며, GLM과 DeepSeek 수치는 확인된 하한이다. 다운로드는 고유 사용자 수가 아니라 파일 요청을 집계한 값이다.

[그림 2] Hugging Face에서 관측한 공개 모델의 활동 현황. 각 계열의 직전 세대와 최신 세대 두 저장소를 합산했다. 파생은 원본과의 직접 관계를 확인한 공개 저장소이며, GLM과 DeepSeek 수치는 확인된 하한이다. 다운로드는 고유 사용자 수가 아니라 파일 요청을 집계한 값이다.

 

파생 저장소의 내용을 보면 공개 이후의 작업 방향이 드러난다. 그림 3에서 정밀도·형식 변환은 Solar 계열 36곳 중 26곳, K-EXAONE 계열 18곳 중 16곳이며, GLM과 DeepSeek에서도 큰 비중을 차지한다. 이 작업은 모델이 배운 내용을 새로 넣기 보다 숫자의 정밀도를 낮추거나 파일 구조를 바꿔, 더 작은 메모리와 다른 추론 엔진에서 실행하게 만든다. 그다음 단계에서는 일부 전문가를 잘라내거나 합쳐 모델 자체를 줄이고, 줄어든 품질을 추가 학습으로 회복한다. 특정 산업·과제에 맞춘 후속 학습이나 본 모델의 답변 생성을 돕는 작은 추론 보조 모델도 여기서 갈라져 나온다. 각 저장소의 모델 카드와 가중치, 코드를 직접 확인해 실제 작업 내용으로 분류했다.14

 

그림 3. 확인된 파생 저장소의 작업 유형. 직전·최신 세대의 고유 Hugging Face 저장소를 실제 변경 내용에 따라 분류했다. 왼쪽은 확인된 수, 오른쪽은 계열별 구성비다. GLM·DeepSeek의 는 분류를 마친 저장소의 하한을 뜻한다.

[그림 3] 확인된 파생 저장소의 작업 유형. 직전·최신 세대의 고유 Hugging Face 저장소를 실제 변경 내용에 따라 분류했다. 왼쪽은 확인된 수, 오른쪽은 계열별 구성비다. GLM·DeepSeek의 는 분류를 마친 저장소의 하한을 뜻한다.

 

숫자만으로는 파생의 쓰임을 알 수 없다. 최신 모델에서 확인된 파생은 Solar Open 2 17곳, K-EXAONE 2.0 3곳, A.X K2 4곳 이다.15 저장소 안의 코드와 실행 설정, 다른 프로젝트가 가져다 쓴 흔적을 함께 봐야 경량화가 로컬 실행으로, 모델 지원이 학 습과 서빙으로 번지는 과정을 읽을 수 있다.

 

Solar Open 2를 이용한 solar-ream은 외부 개발자가 전문가 가지치기와 병합을 적용하고 코드와 결과 가중치를 함께 공개한 경량화 프로젝트다. prometheusAIR의 llama.cpp 패치는 TurboLLM의 빌드 코드에 재사용됐다. 별도의 실행 보고서는 메모리 부족을 해결한 과정과 남은 출력 반복 문제를 기록했고, pilot-upstage-solar-open2는 제공 API를 Codex 등의 도구에 붙인 설정과 검증 로그를 남겼다. 경량화와 로컬 실행, 에이전트 연동이 서로 다른 개발자의 작업으로 이어진 사례다.16

 

K-EXAONE 2.0 주변에서는 학습 도구와 배포 설정, 앱 코드가 서로 다른 저장소에서 만들어졌다. NVIDIA NeMoMegatron-Bridge의 모델 지원은 외부 제출 PR에서 시작해 프로젝트가 자동 시험에 사용하는 CI 변경으로 옮겨갔다. 검증 카드는 대규모 가중치를 변환하고 다시 불러오는 데까지 확인했다고 적어 놓았다. 어느 단계까지 실제로 시험했는지를 다른 개발자가 바로 알 수 있는 기록이다. NVIDIA Dynamo의 배포 구성은 저정밀도 가중치를 서버에서 돌리는 절차를 제공한다. 도구 호출 middleware 수정은 K-EXAONE 2.0의 응답을 앱에서 처리하는 코드다.17

 

A.X K2 지원은 범용 라이브러리에서 시작해 배포 레시피와 외부 벤치마크로 번졌다. Transformers의 A.X K2 지원 덕분에 공 통 라이브러리에서 모델을 불러올 수 있고, NVIDIA Dynamo의 배포 구성은 저정밀도 가중치를 여러 GPU에서 서빙하는 예시를 제공한다. 공개 벤치마크 저장소는 SK텔레콤의 vLLM 지원 코드를 다른 버전에 이식해 B200 8장에서 측정한 설정과 결과를 남겼다. 다음 개발자는 이 기록을 출발점으로 삼아 같은 문제를 다시 풀지 않아도 된다.18

 

사용자가 직접 접하거나 응용 코드에 넣는 사례만 추리면 다음과 같다.

1. Solar 계열 : 로컬 실행에 널리 쓰이는 GGUF 형식의 가중치를 웹 채팅·로컬 API·코딩 에이전트로 실행하는 TurboLLM, Slack·Discord·Telegram·KakaoTalk을 모델 에이전트에 연결하는 TypeClaw, AI 리터러시 교재에서 관련 대목을 찾아 답하는 RAG 웹 앱, 한국 모델의 계보와 구조를 탐색하는 Model Genome Korea, 전문가 가지치기와 병합을 명령줄에서 수행하는 모델 편집 도구 ditch가 있다.

2. K-EXAONE 계열 : 공공서비스 검색·문서·신청 흐름을 잇는 터미널 에이전트 UMMAYA, 페르소나 대화로 가치관을 매칭하는 SoulLink AI, 지속가능경영보고서에서 관련 내용을 찾아 요약하는 ESG Report KR, K-EXAONE 작업을 Claude Code에서 호출하는 ClaudeCODEXaone, 의약품 문서를 검색해 안전 질의에 답하는 pill-safe-ai, Codex·Cursor·Cline·OpenCode가 여러 모델 서버에 접속하도록 단일 주소를 제공하는 MiawRouter가 있다. 

3. A.X 계열 : A.X K2를 GPTQ 방식으로 양자화하는 모델 정의를 제공하는 GPTQModel, 결합된 모듈을 풀어 변환 도구가 처리하게 하는 Defuser, A.X K1 토크나이저를 JavaScript 앱에서 쓰게 하는 tokkit-skt가 있다. 사용자용 독립 앱보다 다른 프로젝트가 가져다 쓰는 라이브러리에서 먼저 활용이 시작됐다.19

 

제품 경쟁력은 연결에서 나온다

확인된 파생은 양자화와 형식 변환처럼 “일단 실행되게 만드는 작업”에 집중돼 있다. 이는 거대 모델의 첫 병목을 푸는 데 필요 한 기반이지만, 특정 업무의 품질을 높인 후속 학습이나 여러 사람이 반복해서 쓰는 앱으로 넘어간 사례는 상대적으로 적다. 다음 단계에서는 변환된 가중치만 올리는 데서 끝내지 않고 실행 명령, 장비 조건, 평가 결과와 예제 앱을 한 묶음으로 공개할 필요가 있다. 더 다양한 사용 사례를 만들려면 총 매개변수 300억 개 미만(<30B)의 소형 모델도 함께 공개하는 편이 좋다. 상대적으로 적은 컴퓨팅 자원으로 직접 실행하거나 후속 학습을 시도할 수 있어야 대학 연구실과 스타트업, 개인 개발자가 자신의 목적에 맞는 실험을 반복할 수 있다. 그래야 파생 저장소 하나가 또 다른 변환본으로 끝나지 않고 실제 사용자와 다음 개발자를 만난다.

 

AI 제품에서 모델은 여러 구성 요소 가운데 하나다. 문서 서비스는 자료를 수집·갱신하고 검색  색인을 만들며, 사용자에게 허용 된 자료만 찾아 응답에 넣는다. 모델의 답이 근거 문서와 맞는지 평가하고, 오류와 응답 속도, 운영 비용도 관리한다. 코딩 에이 전트에는 파일과 명령에 접근하는 권한, 변경 내용을 검토하는 절차가 더해진다. 제품 경쟁력은 데이터, 검색, 모델, 운영이 맞물리는 전체 흐름의 완성도에서 나온다.

 

모델 공개 전략도 이 전체 흐름을 염두에 둬야 한다. 학습 코드는 후속 연구를 낳고, 서빙 엔진은 제품 배포의 문턱을 낮추며, 안정적인 API와 도구 호출은 에이전트가 맡을 일을 넓힌다. 앞서 본 파생 모델과 외부 프로젝트는 이미 개발사 밖에서 이 일을 시작했다. 연구자와 인프라 개발자, 앱 제작자가 각자의 도구에서 모델을 고칠 수 있을 때 공개 모델은 공용 기술이 된다.

 

공개 이후를 운영하는 힘

글로벌 경쟁은 가중치를 공개한 날에도 끝나지 않는다. 국내 모델도 정밀도·형식 변환을 넘어 도메인·과제 후속 학습, 공개 평가, 다른 제작자의 재사용으로 작업의 폭을 넓혀야 한다. 공개 이후의 활동을 다음 모델의 성능과 사용성으로 되돌리는 팀이 결국 앞서간다.

 

연구에서는 재현 가능한 작은 단위를 꾸준히 공개해야 한다. 사전학습 데이터 전체를 공개하지 않더라도 데이터 구성과 처리 규칙, 고정된 모델·코드 버전, 평가 문항과 채점 스크립트, 추가 학습 설정과 실패 조건을 제공할 수 있다. 설명만 있는 기술 보고서에 실행 가능한 코드와 설정이 하나씩 붙으면 외부 연구자가 고치고 재사용할 수 있는 연구 기반이 된다. 실제 GPU에서 검증한 범위까지 분명히 기록하면 외부 연구자는 그 지점에서 바로 다음 실험을 시작할 수 있다.

 

개발에서는 첫 실행 방법을 제품처럼 관리해야 한다. 저정밀도 가중치와 함께 검증한 엔진 버전, GPU·메모리·입력 길이, 도구 호출 설정, 결과 로그를 배포 자산으로 내놓고 모델 전용 분기의 수정 사항을 vLLM·SGLang·Transformers 같은 범용 프로젝트에 반영해야 한다. 새 버전이 나올 때마다 예제를 다시 돌리고, 후속 학습이나 추론 엔진 통합에 참여하는 외부 기여자에게 GPU·API 환경을 제공하면 기여 속도도 빨라진다. 대형 모델에서는 연산 자원도 코드만큼 중요한 참여 기반이다.

 

공개 뒤의 운영이 커뮤니티를 만든다. 오류 제보에서는 재현 조건을 모으고, 외부 PR에는 어디까지 검증했는지와 어느 릴리스에 들어갔는지를 답해야 한다. 이용자가 만든 파생 모델과 배포 레시피에서 드러난 호환 문제는 다음 버전에 반영한다. 한국어 문서 검색의 반복 오류나 코딩 도구의 불안정한 호출이 공개 평가 과제와 수정 PR이 되고, 그 수정이 다음 릴리스에도 남는 식이다. 세 모델 주변에는 이미 이런 움직임이 생겼다. 이제 이를 다음 세대에도 쌓이는 운영 체계로 만들 때다.

 

  

박찬성 프로필 이미지

박찬성은 복잡한 통신 인프라 운용을 효율화하기 위해 한국전자통신연구원에서 네트워크 제어 특화 대형언어모델(LLM)을 연구·개발하고 있다. 더불어 기술 생태계의 지식 공유와 건강한 발전에 기여하고자 Google Developers Expert 및 Hugging Face Fellow로 오픈소스 커뮤니티에서 활동하고 있으며, 국가 차원의 정책 방향을 모색하는 과정에 힘을 보태기 위해 국가인공지능전략위원회 위원 역할을 수행 중이다.

 

주

1. Transformers의 Auto Classes 문서는 저장소의 가중치·설정·어휘 파일을 바탕으로 맞는 모델과 토크나이저 클래스를 고르는 방식을 설명한다. Solar Open 2 모델 카드는 업스테이지의 Transformers·vLLM 분기를, K-EXAONE 2.0 모델 카드는 전용 분기와 OpenAI 호환 API 예제를, A.X K2 모델 카드는 Transformers 본류에 병합된 구조와 SK텔레콤의 vLLM 분기를 안내한다. 공통 인터페이스를 쓴다는 설명이며, 세 모델의 설치 방법과 본류 반영 상태가 같다는 뜻은 아니다.

2. Axolotl과 LLaMA-Factory는 다양한 모델용 학습 설정과 방법을 제공하고, Unsloth는 지원 모델의 자원 효율적인 학습에 초점을 둔다. 이 프로젝트들의 일반적 기능이 세 원본 모델에 대한 직접 지원을 뜻하지는 않는다. 모델 구조·가중치 형식·학습 방식의 지원 여부와 필요한 GPU 구성을 각각 확인해야 한다. 특히 원본 모델을 단일 소비자용 GPU에서 학습할 수 있다는 의미는 아니다.

3. Solar Open 2 모델 카드는 모델 실험에 업스테이지의 Transformers 분기를 안내한다. A.X K2 모델 카드는 Transformers에 통합된 모델 구조를 소스에서 설 치하고 FP8 실행용 kernels 패키지를 추가하도록 안내한다. K-EXAONE 2.0의 대규모 추가 학습 경로로는 Megatron-Bridge의 `k-exaone-2` 분기가 공개돼 있다. 검증 카드는 가중치 변환 검증과 전체 사전학습·SFT·PEFT 미검증을 구분한다. verl·OpenRLHF의 세 모델별 실행 레시피가 확인됐다는 뜻은 아니다.

4. 평가 도구의 과제와 모델 연결 방법은 도구마다 다르다. 동일 조건 비교를 위해서는 평가 데이터의 버전뿐 아니라 채팅 템플릿, 추론 모드, 생성 길이와 채점 방식도 맞춰야 한다. 모델 서버의 API를 이용한 평가와 가중치를 직접 불러오는 평가는 필요한 통합 작업이 다르다.

5. 그림 1은 제공된 ‘Tech Report 공개 범위 매트릭스 판독 기준’의 분류를 따른다. Solar Open 2, K-EXAONE 2.0, A.X K2, GLM-5, DeepSeek-V4.1-Flash의 선택한 공식 보고서가 기본 범위다. 직전 보고서의 값은 현행 보고서가 동일성을 명시한 구성 요소에만 보완 근거로 사용했다. ‘미확인’은 인터넷 전체의 미공개 판정이 아니고, ‘재학습 산출물’은 최종 가중치가 아닌 전체 학습 코드·설정·데이터 목록·seed·중간 체크포인트·로그를 뜻한다. GLM 행은 GLM-5.3이 인용한 GLM-5 보고서의 공개 범위이며, GLM-5.3의 추가 훈련 정보에 대한 판정이 아니다.

6. Solar Open 2 모델 카드의 빠른 시작 예시는 메모리 141GB 이상 GPU 8장을 가정하며, 개요에는 최소 H200 4장·권장 8장으로 표기한다. K-EXAONE 2.0 모델 카드는 BF16 원본을 두 노드의 H200 8장씩으로 서빙한다. A.X K2 저장소의 FP8 측정 기준은 메모리 275GB의 B300 4장이며, 가중치가 GPU 메모리 약 656GiB를 차지한다고 안내한다. 문맥 길이·동시 처리량·정밀도에 따라 필요 장비는 달라진다.

7. Solar Open 2는 업스테이지의 vLLM 전용 이미지 또는 분기를, A.X K2는 SK텔레콤의 vLLM 분기를 안내한다. K-EXAONE 2.0 모델 카드는 vLLM·SGLang 전 용 분기를 안내하지만, vLLM v0.27.0 릴리스에는 K-EXAONE 2.0의 모델 지원이 포함됐다. 해당 모델의 권장 설정과 다른 기능까지 모두 본류에서 검증됐다는 뜻은 아니므로 실행 설정을 확인해야 한다.

8. Solar Open 2의 양자화 모델 안내, K-EXAONE 2.0 모델 모음, A.X K2 모델 카드를 참조했다.

9.원본의 전체 매개변수 수에 4비트(0.5바이트)를 곱한 십진 단위의 이론적 가중치 크기다. 양자화 방식의 메타데이터, 비양자화 계층, 실행 버퍼, KV 캐시와 운 영 여유 메모리는 포함하지 않는다. 실제 공개 저정밀도 모델의 크기나 실행 요건과 같지 않다.

10. OpenClaw의 vLLM 공급자 안내는 OpenAI 호환 /v1/chat/completions와 /v1/models를 사용한다. 세 원본 모델에 대한 OpenClaw의 개별 검 증 사례를 확인했다는 의미는 아니며, 해당 모델이 vLLM에서 제공되고 도구 호출 파서가 맞게 설정된 경우의 연결 경로다.

11. Solar Open 2 모델 카드는 로컬 vLLM 서버를 Hermes Agent·Claude Code에 연결하는 예제를, K-EXAONE 2.0 모델 카드는 OpenCode의 사용자 정의 서버 설정을 제공한다. A.X K2 모델 카드는 vLLM 분기에서 도구 호출과 추론 응답을 분리하는 파서 설정을 안내한다. 이 예제들이 다른 에이전트의 작업 성공률을 검증한 것은 아니다.

12. OpenCode, Cline, OpenHands는 사용자 정의 또는 호환 모델 공급자를 안내한다. Codex CLI 설정 문서는 외부 공급자와 responses 형식을, vLLM의 Codex 연동 안내는 해당 API로 연결하는 방법을 설명한다. Solar Open 2 모델 카드의 Claude Code 예제는 vLLM의 Anthropic 호환 /v1/messages를 사용한다. 실제 동작에는 API 호환성뿐 아니라 모델별 도구 호출 형식과 에이전트의 여러 단계 작업 검증이 필요하다.

13. 그림 2는 제공된 Hugging Face 활동 그림의 좋아요, 누적 다운로드, 직계 파생 수를 옮겼다. 각 계열에서 직전·최신 두 공식 모델 저장소를 더한 값이며 좋아 요는 고유 사용자 수로 중복 제거하지 않았다. Hugging Face의 `downloads_all_time` 설명과 모델 다운로드 집계 방식에 따르면 누적 다운로드는 지정된 파일에 대한 GET·HEAD 요청을 포함하므로 고유 사용자 수나 가중치 전체의 실제 이용 횟수가 아니다. 파생은 Model Tree의 직계 관계를 확인한 공개 저장소이며 다른 플랫폼과 부모 관계가 표시되지 않은 저장소는 포함하지 않는다. 2026년 9월 말에 조사한 횡단면 자료이며 세대별 공개 기간이 달라 모델 간 채택률이나 다운로 드 대비 파생 전환율로 사용하지 않는다.

14. 그림 3도 제공된 파생 유형 조사에 따른다. 최신·직전 세대의 고유 Hugging Face 저장소를 합산했고, finetune 등의 Hub 관계 태그를 그대로 쓰지 않고 모델 카드·가중치와 작업 내용을 검토해 변경 유형을 분류했다. GLM·DeepSeek의 는 분류가 끝난 저장소의 하한이다. 오른쪽 비율은 확인된 집합 안의 구성비이 며 전체 파생 생태계의 비율이나 실제 서비스 이용 비율은 아니다. 하나의 제작자가 여러 정밀도 버전을 별도 저장소로 올릴 수 있고 개발사의 공식 변형도 포함 된다.

15. 별도로 검증한 세 현행 모델의 직계 파생 저장소는 Solar Open 2 17곳, K-EXAONE 2.0 3곳, A.X K2 4곳이다. Solar의 17곳은 개발사 외 계정에 게시됐지만 공식 협력사 결과물도 있어 모두 독립적인 개인 기여라는 뜻은 아니다. K-EXAONE의 세 곳은 공식 저정밀도 가중치 두 곳과 제작자가 작동 문제를 명시한 외부 GGUF 한 곳이다. A.X K2의 네 곳은 공식 계정 게시물이며, 저정밀도·GGUF 두 곳과 추론 보조 모델 두 곳이다. 공개 저장소와 카드의 검토 결과이며 조사자가 전체 가중치를 독립 실행한 결과는 아니다.

16. solar-ream 저장소는 입력 모델·구현 코드·결과 모델을 연결한다. TurboLLM의 패치 적용 코드는 다른 제작자의 llama.cpp 패치를 가져오는 경로를 보여준다. WHYKEYSAY 실행 보고서는 일부 실행 성공과 출력·자원 제약을 함께 기록한다. pilot-upstage-solar-open2는 주로 제공 API로 에이전트 도구를 연결하므로 가중치 직접 실행 수와 합치지 않는다. 공개 코드와 작성자의 기록을 검토한 것이며 조사자의 GPU 재실행은 아니다.

17. NeMo의 원 제출 #5189와 CI 미러 #5191은 같은 초기 기여의 전달 경로로 묶었다. 검증 카드는 import/reload를 확인하고 전체 훈련은 미검증으로 남긴다. Dynamo 배포 구성은 NVFP4 가중치를 대상으로 하며, 본문에 언급한 middleware PR은 API 응답 처리 코드다. 이들은 각각 다른 종류의 지원이므로 하나의 완성된 종단간 학습·서비스 검증으로 묶지 않는다.

18. A.X K2 모델 카드에 따르면 Transformers 지원은 통합됐으나 안내 시점에는 소스 설치가 필요하다. Dynamo의 A.X K2 구성은 원본 가중치가 아닌 NVFP4 버전을 사용하며, 8장 또는 12장의 B200을 쓰는 배포 예시를 제공한다. 별도의 backport 설명과 측정 기록은 외부 계정이 공개한 실행 근거다. 조사자가 동일 장비에서 다시 측정한 결과는 아니다.

19. TypeClaw과 AI 리터러시 RAG 앱은 Upstage API의 solar-open2 별칭을 쓰지만 공개된 250B 체크포인트와 같은 revision인지는 확인되지 않았고, RAG 앱의 공개 주소는 재조회 때 열리지 않았다. Model Genome Korea는 추론 서비스가 아니라 분석 결과 탐색 앱이다. UMMAYA의 실제 기관 신청·결제 기능 일부는 Mock 또는 Handoff이며, SoulLink AI는 소스가 공개돼 있으나 OSI 오픈소스 라이선스가 확인되지 않았다. ESG Report KR은 재시험에서 문서 검색까지 작동했지만 모델 답변 호출은 실패했다. MiawRouter는 K-EXAONE 2.0 연결 코드를 릴리스했으나 이후 공급자 모델 목록에서 해당 모델이 내려간 정황이 확인 됐다. GPTQModel·Defuser의 모델 등록과 정식 릴리스는 확인했지만 688B 전체 모델의 양자화·실행 성공으로 확대 해석하지 않는다.

 

 

5개 / 10개