State of Open Models 2026년 여름 리포트로 보는 오픈소스 AI 생태계 흐름
Hub 성장 통계와 에이전트 트래픽 데이터가 도구 선택에 주는 힌트
오픈소스 AI 모델을 도입하려는 팀이라면 한 번쯤 이런 고민을 한다. 좋아요와 다운로드 수가 높은 모델을 고르면 안전할까, 아니면 실제로 많이 쓰이는 모델과 화제가 되는 모델은 다를까. 이런 판단을 감으로만 하기는 어렵고, Hub 전체의 흐름을 보여주는 데이터가 있다면 훨씬 근거 있는 선택을 할 수 있다. 최근 Hugging Face가 이런 흐름을 정리한 리포트를 공개했다.
2026년 여름, Hub는 얼마나 커졌나
모델·데이터셋·Space 증가 추이
Hugging Face가 발표한 바에 따르면, 2026년 1월부터 8월 사이 공개 모델 저장소는 243만 개에서 296만 개로 늘었다. 데이터셋은 71만1천 개에서 100만 개로, Space는 100만 개에서 144만 개로 각각 증가했다. 다만 이 성장이 고르게 퍼져 있는 것은 아니다. 전체 모델 저장소의 약 85.6%는 누적 다운로드 수가 200회 미만이고, 반대로 상위 1.5%의 저장소가 전체 활동량의 99.2%를 차지하는 것으로 나타났다. 즉 저장소 수 자체는 빠르게 늘고 있지만, 실제 사용은 극히 일부 저장소에 몰려 있는 구조다.
에이전트 트래픽이라는 새로운 측정 기준
이번 리포트에서 특히 눈에 띄는 부분은 코딩 에이전트가 Hub에 접근할 때 남기는 토큰을 바탕으로 만든 에이전트 트래픽 데이터셋이다. 이 데이터에 따르면 Claude Code는 4월 기준 전체 트래픽의 67.8%를 차지했지만 7월에는 44.4%로 비중이 줄었고, 같은 기간 Codex는 10.4%에서 20.8%로 꾸준히 늘었다. 7월 기준 태그가 붙은 트래픽 중 약 25%는 아직 이름이 알려지지 않은 도구에서 발생했고, 4월부터 7월 사이 새로운 클라이언트 식별자가 열 개 넘게 새로 등장했다고 한다.
이 데이터가 실제 도구 선택에 주는 힌트
모델 크기와 실제 사용량의 관계
리포트에 따르면 파라미터 10억 개 미만의 소형 모델이 전체 누적 다운로드의 83%를 차지했고, 1,000억 개를 넘는 대형 모델은 1%에 불과했다. 2026년 한 해만 놓고 봐도 700억 개 이상 모델의 다운로드 비중은 3%에 그쳤다. 실무에서 오픈소스 모델을 고를 때, 무작정 파라미터 수가 큰 모델을 우선순위에 두기보다 실제로 널리 쓰이는 소형·중형 모델부터 검토해볼 만하다는 근거로 삼을 수 있다.
좋아요 수와 다운로드 수는 다른 신호
리포트는 좋아요 상위 25개 저장소와 다운로드 상위 25개 저장소 중 겹치는 항목이 단 하나뿐이었다고 밝혔다. 이는 커뮤니티에서 화제가 되는 모델과 실제 인프라에 채택돼 쓰이는 모델이 서로 다른 신호라는 뜻이다. 모델을 검토할 때 좋아요 수만 보고 판단하기보다, 실제 다운로드 추이나 다른 프로젝트에서의 채택 사례까지 함께 확인하는 편이 안전하다.
에이전트 트래픽 구도가 바뀌고 있다는 점 감안하기
몇 달 사이에도 코딩 에이전트별 트래픽 비중이 크게 바뀌고 새로운 도구가 계속 등장하는 것을 보면, 특정 에이전트나 도구 하나에만 워크플로우를 맞춰두는 것은 리스크가 있다. 도구 생태계가 빠르게 바뀌는 시기인 만큼, 특정 벤더에 종속되지 않는 형태로 연동을 설계해두는 편이 이후 전환 비용을 줄여준다.
이 리포트를 읽을 때 주의할 점
이 통계는 Hugging Face Hub 안에서 벌어지는 활동만 반영한다는 점을 감안해야 한다. 사내에서 자체 호스팅하거나 다른 플랫폼을 통해 배포되는 모델의 사용량은 이 데이터에 잡히지 않으므로, Hub 통계만으로 전체 오픈소스 생태계의 흐름을 단정하기는 어렵다.
또한 에이전트 트래픽 비중은 몇 달 사이에도 크게 흔들린 것으로 나타난 만큼, 특정 시점의 스냅샷을 절대적인 기준으로 삼기보다는 추세의 방향성 정도로 참고하는 편이 안전하다. 다음 리포트가 나올 때 비중이 또 달라질 가능성을 열어두고 지켜볼 필요가 있다.
정리
Hub 전체 규모는 계속 커지고 있지만 실제 활동은 일부 저장소와 소형 모델에 집중돼 있고, 코딩 에이전트 생태계 역시 몇 달 사이 구도가 바뀔 만큼 유동적이다. 오픈소스 AI 도구를 도입하는 팀이라면 좋아요 수 같은 단편적인 지표보다 실제 다운로드 추이와 채택 사례를 함께 살펴보고, 특정 에이전트나 벤더에 지나치게 종속되지 않는 방향으로 워크플로우를 설계해두는 편이 안전하다.
핵심 요약
- 2026년 1~8월 사이 Hub의 모델·데이터셋·Space 저장소 수가 크게 늘었지만 활동은 일부에 집중돼 있다.
- 코딩 에이전트별 Hub 트래픽 비중은 몇 달 사이에도 크게 바뀔 만큼 유동적이다.
- 실제 다운로드는 소형 모델에 집중돼 있어 대형 모델 우선 선택이 항상 유리하지는 않다.
- 좋아요 수와 다운로드 수는 서로 다른 신호이므로 함께 확인하는 편이 안전하다.
초보자가 자주 실수하는 포인트
- 좋아요 수가 많다는 이유만으로 실제 채택 사례를 확인하지 않고 모델을 선택하는 경우
- 파라미터 수가 큰 모델일수록 무조건 더 나은 선택이라고 단정하는 경우
- 특정 코딩 에이전트 하나에만 워크플로우를 맞춰두고 도구 생태계 변화를 감안하지 않는 경우
체크리스트
- 고려 중인 모델의 실제 다운로드 추이와 다른 프로젝트 채택 사례를 함께 확인했는가
- 모델 크기와 팀의 실제 요구 사양이 맞는지 검토했는가
- 워크플로우가 특정 코딩 에이전트나 벤더에 과도하게 종속돼 있지 않은가
- 이 통계가 Hugging Face Hub 활동만 반영한다는 한계를 감안했는가
자주 묻는 질문
좋아요 수가 높은 모델을 고르면 안전한가요?
좋아요 수만으로 판단하기는 어렵다. 리포트에 따르면 좋아요 상위 목록과 다운로드 상위 목록이 거의 겹치지 않으므로, 실제 다운로드 추이와 채택 사례를 함께 확인하는 편이 안전하다.
대형 모델보다 소형 모델을 우선 검토해야 하나요?
항상 그런 것은 아니지만, 실제 다운로드의 대부분이 소형 모델에 몰려 있다는 점을 고려하면 팀의 요구 사양에 소형·중형 모델이 맞는지 먼저 검토해볼 가치는 있다.
이 글은 초보자 기준으로 이해하기 쉽게 정리되었으며, 내용은 운영 과정에서 순차적으로 보완될 수 있습니다.