개발 · 2026. 8. 19.31

Qwen 3.8 등장

목차

알리바바가 지난 8월 3일(현지 시각), Qwen 시리즈의 새 플래그십 Qwen3.8-Max와 그 오픈 웨이트 버전인 Qwen3.8-2.4T-A95B, 그리고 별도의 경량 모델 Qwen3.8-27B를 함께 공개했다. 단순한 마이너 업데이트가 아니라 "Max급 모델을 처음으로 오픈 웨이트로 공개한다"는 점에서 발표 직후 AI 업계에서 꽤 시끄러웠던 소식이라, 이번 주에는 평소의 뉴스 큐레이션 대신 이 모델 하나를 조금 더 깊게 파보기로 했다.

무엇이 나왔나

이번 발표는 세 갈래로 나뉜다.

  • Qwen3.8-Max: QwenCloud API로만 제공되는 클로즈드 플래그십. 텍스트·이미지·비디오를 함께 입력받는 네이티브 멀티모달 모델이다.
  • Qwen3.8-2.4T-A95B: Max와 같은 2.4T 파라미터 아키텍처를 오픈 웨이트로 공개한 버전. 다만 뒤에서 다루겠지만 Max와 완전히 동일한 스펙은 아니다.
  • Qwen3.8-27B: 더 가볍고 실사용하기 쉬운 덴스(dense) 모델로, 이미지·비디오 처리까지 포함한 멀티모달을 지원한다.

Bloomberg와 The Information 보도에 따르면 알리바바는 이 발표에서 "일부 벤치마크에서 Kimi K3를 앞선다"고 주장했고, Max와 27B 모델의 가중치를 "다음 주 중" 공개하겠다고 예고했다. (Techmeme 정리)

아키텍처: 2.4T 파라미터, 실제로 켜지는 건 95B

Qwen3.8-Max/2.4T-A95B는 이름 그대로 총 2.4조 파라미터 중 토큰당 950억 파라미터만 활성화되는 MoE(Mixture-of-Experts) 구조다. 활성화 비율로 치면 약 4% 수준이다.

공식 모델 카드 기준 세부 구조는 다음과 같다. (Hugging Face 모델 카드)

  • 총 92개 레이어. 23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)) 형태로, 선형 어텐션(Gated DeltaNet)과 일반 어텐션(Gated Attention)을 섞어 쓰는 하이브리드 구조다.
  • Gated DeltaNet은 128개의 value 헤드와 16개의 query/key 헤드(헤드당 128차원)를, Gated Attention은 64개 query 헤드와 4개 key-value 헤드(헤드당 256차원, RoPE 64차원)를 사용한다.
  • MoE는 총 512개 전문가(expert) 중 라우팅되는 10개 + 항상 켜지는 shared expert 1개, 총 11개가 토큰마다 활성화된다.
  • 컨텍스트는 네이티브 262,144 토큰이며, 최대 약 101만 토큰까지 확장 가능하다고 명시되어 있다.

하이브리드 어텐션 + 대규모 MoE 조합은 최근 중국 모델들(Kimi K3, GLM-5.2 등)에서 공통적으로 보이는 트렌드인데, Qwen도 같은 방향으로 수렴한 셈이다.

가격: 이전 세대보다 오히려 저렴해졌다

QwenCloud API 기준 가격은 다음과 같다.

항목 가격
입력 (캐시 미스) $2.00 / MTok
출력 $6.00 / MTok
캐시된 입력 $0.25 / MTok

직전 세대인 Qwen3.7-Max($2.50 / $7.50)보다 입출력 모두 낮아졌고, 경쟁 모델인 Kimi K3(입력 $3, 출력 $15)와 비교해도 특히 출력 단가에서 확실히 저렴한 편이다. 대형 MoE 모델들이 대체로 가격을 낮추는 방향으로 가고 있는 걸 보여주는 사례이기도 하다.

벤치마크: 코딩·에이전트 작업에서 강세

제3자 평가 지표인 Vals Index 기준으로는 종합 점수 66.1을 기록해 Claude Opus 4.7과 비슷한 수준으로 보고됐고, 세부적으로는 SWE-bench 87.3%(GPT-5.5의 82.6%를 상회), Terminal-Bench 2.1에서 67.4점(직전 Qwen3.7의 61.0에서 상승)을 기록했다고 알려졌다. Arena 순위에서는 Frontend Code Arena 4위(1,668 Elo, 1위 Claude Opus 5는 1,705), Vision Arena 2위(1,305 Elo)라는 결과도 함께 보도됐다. (Latent.Space AINews 정리)

다만 이 수치들은 출시 직후 각종 매체가 인용한 제3자 평가 결과라, 공식 벤치마크처럼 단정하기보다는 "현재까지 알려진 바로는" 정도로 받아들이는 게 안전하다. 출시 초기 벤치마크는 이후 재현 검증 과정에서 수치가 흔들리는 경우가 종종 있다.

눈에 띄는 건 벤치마크보다 에이전틱 데모

개인적으로는 벤치마크 점수보다 알리바바가 함께 공개한 장시간 자율 작업 데모들이 더 흥미로웠다.

  • 자체 개선(self-evolving) 하네스를 이용한 10일 이상의 자율 코딩 작업
  • 500턴 이상에 걸친 칩 설계 최적화로 게이트 수를 8,298개에서 678개로, 다이 면적을 81% 줄인 사례
  • 365일 규모의 가상 이커머스 운영 시뮬레이션에서 협상·계획 수립을 통해 4.16배 수익률(잔고 ¥416,252) 달성
  • 한 연구 논문의 파이프라인을 재구현해 125시간 동안 반복 개선하며 원 논문 벤치마크를 2.71점 상회

물론 이런 데모는 알리바바가 직접 선별해 공개한 최적의 사례일 가능성이 높다는 점은 감안해야 한다. 그래도 "며칠~몇 주 단위로 사람 개입 없이 돌아가는 에이전트"를 지향점으로 잡고 있다는 방향성 자체는 최근 프론티어 모델들의 공통된 흐름과 일치한다.

오픈 웨이트인데, 27B와 Max는 조건이 다르다

여기서부터가 실무적으로 가장 챙겨볼 만한 부분이다. 두 오픈 웨이트 모델은 라이선스가 다르다. (관련 정리 글)

  • Qwen3.8-27B: Apache 2.0. 별다른 상업적 제약 없이 자유롭게 쓸 수 있다.
  • Qwen3.8-2.4T-A95B(Max 오픈 웨이트): qwen3.8-max라는 커스텀 라이선스. MAU 1억 명 또는 월 매출 2천만 달러를 넘는 서비스는 UI에 모델명을 명시해야 하고, MaaS나 AI 업무 보조 사업으로 12개월 누적 매출 5천만 달러를 넘기면 별도 라이선스 계약이 필요하다.

또 하나, 공개 직후 "이 라이선스가 미국·EU·영국·한국 등에서 사용을 제한한다"는 루머가 돌았는데, 실제 라이선스 원문에는 지역·관할권 관련 조항이 없는 것으로 확인됐다. 다른 모델(MiniMax H3 등)의 지역 제한 이슈와 섞여 와전된 것으로 보인다. 다만 한국 사용자 입장에서는 애초에 이런 얘기가 나올 정도로 최근 오픈 웨이트 라이선스에 지역 제한 조항이 흔해지고 있다는 점 자체는 눈여겨볼 만하다.

그리고 오픈 웨이트 Max는 클라우드판 Max와 스펙이 완전히 같지 않다. Hugging Face 모델 카드와 커뮤니티 논의에 따르면 오픈 웨이트로 공개된 Qwen3.8-2.4T-A95B는 텍스트 전용이며(비전·비디오 입력 미지원), 사고(thinking) 모드를 끌 수 없고, 컨텍스트도 클라우드판이 지원하는 최대 약 100만 토큰이 아니라 훨씬 짧은 범위로 제한된다. "Max와 동일한 파라미터 수 = Max와 동일한 성능"은 아니라는 뜻이라, 로컬/셀프호스팅을 검토 중이라면 이 차이를 먼저 확인하는 게 좋다.

정리하면

Qwen3.8은 스펙 경쟁보다는 "가격을 낮추면서 에이전틱 작업 능력을 끌어올린다"는 최근 프론티어 모델들의 공통된 방향을 그대로 보여주는 사례에 가깝다. 실무 관점에서 챙길 포인트를 꼽자면,

  • 코딩·터미널·장시간 에이전트 작업 벤치마크에서 상위권으로 보고되고 있고, 가격은 오히려 이전 세대보다 낮아졌다.
  • 오픈 웨이트가 처음으로 Max급까지 내려왔다는 상징성은 크지만, 실제로 받는 모델은 클라우드판과 스펙이 다르고 상업적 조건이 붙는 커스텀 라이선스라는 점을 확인하고 써야 한다.
  • 이번처럼 신모델 공개 직후에는 부정확한 소문(지역 제한 등)이 먼저 퍼지는 경우가 많으니, 실제 도입을 고려한다면 모델 카드와 라이선스 원문을 직접 확인하는 편이 안전하다.

가중치가 실제로 Hugging Face에 올라오고 커뮤니티 벤치마크가 쌓이면, 초기 발표 수치가 얼마나 재현되는지도 한 번 더 짚어볼 만한 주제다.