‘독파모’라는 낯선 줄임말이 8월 18일 검색창에 자주 등장했다. 독자 AI 파운데이션 모델 프로젝트의 2차 평가 결과가 발표되면서다. 결과만 보면 세 팀이 다음 단계에 진출했다는 소식이다. 사용자에게 더 중요한 질문은 따로 있다. 어떤 기준으로 AI 모델을 비교했고, 그 점수가 실제 사용 경험과 얼마나 이어지는지 살펴보는 일이다.

세 가지 AI 모델을 벤치마크와 전문가·사용자 평가 관점에서 비교하는 장면

 

독파모는 무엇을 줄인 말일까

독파모는 독자 AI 파운데이션 모델을 줄여 부르는 말이다. 특정 서비스 하나가 아니라 여러 AI 서비스의 토대가 되는 범용 모델을 국내 기술로 개발하는 프로젝트를 가리킨다. 글쓰기나 요약 같은 언어 작업뿐 아니라 산업 현장의 여러 응용 서비스로 확장할 수 있는 기반을 만든다는 취지다.

2026년 8월 18일 발표된 2차 단계평가에서는 LG AI연구원, SK텔레콤, 업스테이지가 다음 단계에 진출했다. 최종 선정은 아직 끝나지 않았다. 지금의 결과를 최종 우승이나 완성된 제품 순위처럼 받아들이기보다 개발 과정 중 한 차례의 종합 점검으로 보는 편이 정확하다.

 

평가표에서 먼저 볼 세 축

이번 평가는 벤치마크, 전문가 평가, 사용자 평가를 함께 반영했다. 세 항목은 서로 다른 질문에 답한다.

벤치마크는 기본기를 확인한다

벤치마크는 정해진 문제를 모델이 얼마나 잘 푸는지 수치로 비교하는 시험에 가깝다. 수학, 코딩, 추론, 한국어 이해처럼 반복 측정이 필요한 능력을 비교할 때 유용하다. 다만 높은 점수가 모든 실제 작업에서 더 편리하다는 뜻은 아니다. 시험 문제의 범위와 실제 사용 환경이 다를 수 있기 때문이다.

전문가 평가는 확장 가능성을 본다

전문가 평가는 모델의 기술 구조만 살피지 않는다. 산업에 적용할 수 있는지, 개발 생태계에 기여할 계획이 있는지, 위험 요인을 어떻게 관리하는지 같은 부분도 검토한다. 모델을 오래 운영하고 여러 서비스에 연결하려면 이런 조건이 성능 수치만큼 중요해진다.

사용자 평가는 손에 잡히는 효용을 묻는다

사용자 평가는 사람들이 모델을 직접 써 보며 결과의 유용성과 사용성을 판단하는 과정이다. 답변이 정확해도 지시를 자주 오해하거나 결과 형식이 불안정하면 실무에서는 불편하다. 반대로 특정 업무 흐름에 잘 맞는 모델은 단일 점수가 조금 낮더라도 충분히 가치가 있을 수 있다.

 

순위보다 확인할 다섯 가지

AI 모델 평가 기사를 읽을 때는 다음 다섯 가지를 차례로 확인하면 과장된 인상을 줄일 수 있다.

  1. 평가가 어떤 문제와 언어를 다뤘는지 본다. 한국어 업무에 쓸 모델이라면 한국어 이해와 생성 평가가 포함됐는지 확인한다.
  2. 점수 차이가 실제로 큰지 살핀다. 순위가 달라도 점수 차이가 작다면 용도에 따라 선택이 바뀔 수 있다.
  3. 모델 크기와 운영 비용을 함께 본다. 큰 모델이 강한 경우가 많지만 필요한 장비와 응답 비용도 늘 수 있다.
  4. 긴 문서, 수학, 코딩, 환각 억제처럼 자신에게 필요한 세부 능력을 찾는다. 종합점수만으로는 강점과 약점이 가려진다.
  5. 공개 범위와 사용 조건을 확인한다. 모델 파일 공개, 라이선스, 상업 이용 가능 여부는 실제 활용에 직접 영향을 준다.

 

내 용도에 맞춰 비교하는 간단한 방법

먼저 하려는 일을 한 문장으로 적는다. 예를 들어 긴 보고서 요약, 한국어 고객 문의 분류, 코딩 보조처럼 작업을 구체화한다. 그다음 대표 입력 5~10개를 준비해 같은 조건으로 여러 모델에 넣는다. 답변의 정확성, 형식 준수, 처리 속도, 수정 횟수를 기록하면 된다.

민감한 개인정보나 회사 기밀은 공개형 서비스의 테스트 입력으로 쓰지 않는다. 비용을 비교할 때도 한 번의 응답 가격만 보지 말고 원하는 결과를 얻기까지 다시 요청한 횟수까지 포함해야 한다. 모델 이름보다 실제 업무에서 드는 총시간이 더 현실적인 기준이다.

 

자주 묻는 질문

2차 평가를 통과한 모델이 무조건 더 좋은가

이번 평가 기준에서 종합적으로 높은 평가를 받은 것은 맞지만 모든 용도에서 항상 우수하다는 뜻은 아니다. 글쓰기, 코딩, 긴 문서 처리, 속도처럼 필요한 능력에 따라 체감 결과는 달라진다.

파라미터가 많으면 성능도 항상 좋은가

파라미터 수는 모델 규모를 보여주는 한 가지 지표다. 학습 데이터의 품질, 학습 방식, 추론 최적화, 필요한 장비까지 함께 봐야 하므로 숫자 하나로 성능을 단정하기 어렵다.

오픈소스로 공개되면 바로 무료로 쓸 수 있나

공개 범위와 라이선스에 따라 다르다. 모델 파일을 내려받을 수 있어도 실행에 필요한 GPU 비용이 들 수 있고, 상업 이용이나 재배포 조건이 따로 붙을 수 있다. 실제 공개 페이지의 라이선스와 사용 설명을 확인해야 한다.

 

지금 기억할 한 줄

독파모 2차 결과는 국내 AI 개발의 진행 상황을 보여주는 중간 점검표다. 순위 하나보다 벤치마크, 전문가 검토, 사용자 평가가 각각 무엇을 측정했는지 나눠 보면 내게 필요한 모델을 훨씬 현실적으로 고를 수 있다. 이후 최종 평가와 공개 조건이 발표되면 같은 기준으로 다시 비교해 보자.

+ Recent posts