Qwen 3.8 27B
Qwen3.8-27B는 기본 1M 컨텍스트 길이와 공식 내장 도구 등 프로덕션 기능을 확대한 호스팅 버전으로 제공될 예정임. 자세한 내용은 Qwen3.8-27B 개요에서 확인할 수 있으며, 서비스는 곧 출시됨
Qwen3.8은 Qwen 오픈 모델 제품군 가운데 현재까지 가장 강력한 세대로, Qwen3.5의 아키텍처를 기반으로 주요 역량을 확대함
코딩, 전문 업무, 연구, 장기 에이전트 작업 전반에서 성능을 높였고, 자율 계획과 환경 피드백 처리 능력을 강화해 복잡한 다단계 작업을 끝까지 더 안정적으로 수행함
27B dense 모델은 배포하기 쉬운 비교적 작은 크기에 이미지·동영상을 이해하는 네이티브 비전-언어 기능과 유연한 사고 제어를 결합함
인기 에이전트 하네스와 개발 도구 지원 범위도 넓혀 기존 스택에 통합하기 쉬워짐
사고 모드는 기본 활성화되며 요청별 비활성화와 추론 깊이 조절을 지원함
reasoning_effort로 추론 깊이를 조정할 수 있고,preserve_thinking으로 이전 메시지의 추론 컨텍스트를 유지함이미지·STEM 도표·문서부터 수 시간 분량 동영상까지 네이티브로 이해 가능함
모델 구성
비전 인코더를 포함한 인과 언어 모델로, 사전 학습과 사후 학습을 거침
언어 모델은 27B 파라미터, hidden dimension 5,120, padded token embedding 및 LM output 248,320, 64개 layer로 구성됨
hidden layout은
16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))임Gated DeltaNet은 V용 linear attention head 48개와 QK용 16개를 사용하며 head dimension은 128
Gated Attention은 Q head 24개와 KV head 4개를 사용하며 head dimension은 256, rotary position embedding dimension은 64
FFN intermediate dimension은 17,408
MTP(Multi-Token Prediction)는 여러 단계로 학습했으며, 컨텍스트 길이는 네이티브 262,144 tokens이고 최대 1,000,000 tokens까지 확장 가능함
텍스트 성능
Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus4.6 Max | |
|---|---|---|---|---|---|
코딩 | |||||
에이전트 터미널 코딩 Terminal Bench 2.1 (Terminus) | 73.0 | 63.4 | 64.0 | 51.7 | 78.2 |
에이전트 코딩 SWE-bench Pro | 61.7 | 53.5 | 57.6 | 51.2 | 53.4 |
저장소 단위 코드 생성 NL2Repo-Bench | 42.3 | 36.2 | 41.1 | -- | 47.6 |
에이전트 코딩 DeepSWE 1.1 | 42.2 | 13.3 | 14.2 | -- | -- |
소프트웨어 엔지니어링 QwenSWEBench | 79.0 | 49.3 | 59.2 | -- | 63.8 |
에이전트 | |||||
장기 오피스 업무 CoWorkBench | 70.7 | 61.0 | 65.1 | -- | 68.2 |
전문 직무 작업 JobBench | 33.4 | 21.8 | 27.6 | -- | -- |
최전선 에이전트 작업 Agents' Last Exam | Pass@1 20.4, Score 42.9 | Pass@1 10.6, Score 27.3 | Pass@1 13.2, Score 33.6 | -- | -- |
일반 | |||||
지시 이행 IFBench | 79.5 | 69.1 | 79.1 | 77.0 | 62.5 |
과학 추론 GPQA Diamond | 89.2 | 87.8 | 90.3 | 83.5 | 91.3 |
다학제 추론 HLE | 30.8 | 24.0 | 34.7 | 22.0 | 40.0 |
경쟁 프로그래밍 LiveCodeBench v6 | 90.3 | 83.9 | 89.6 | -- | 88.8 |
텍스트 벤치마크에서는 Qwen3.8-27B가 13개 항목 중 10개에서 최고 점수를 기록함
Opus4.6 Max가 앞선 항목은 Terminal Bench 2.1, NL2Repo-Bench, GPQA Diamond, HLE이며, Qwen3.8-27B는 나머지 코딩·에이전트·일반 지표에서 대체로 이전 Qwen 모델을 웃돌았음
평가는 항목별 조건이 달라 단순 수치 비교에 제한이 있음
SWE-bench Pro는 공식 보고 점수를 사용한 Opus4.6 Max를 제외하고 Claude Code harness,
temp=1.0,top_p=0.95, 256K 컨텍스트로 평가했으며, 문제가 있는 작업을 수정한 뒤 모든 baseline 모델을 다시 측정함NL2Repo-Bench는 Claude Code harness를 사용했고 reward hacking을 막기 위해 특정 저장소에 접근하려는
pip download,pip install,git clone등의 Bash 명령을 차단함DeepSWE 1.1은 Claude Code harness,
temp=1.0,top_p=0.95, 256K 컨텍스트 조건으로 측정함자체 소프트웨어 엔지니어링 벤치마크 QwenSWEBench는 Claude Code harness에서 8시간 timeout,
max_tokens=32,768,temperature=1.0, 256K 컨텍스트를 적용해avg@3를 보고함CoWorkBench는 컴퓨터 과학·금융·법률·의료 등 생산성 분야의 장기 작업을 평가하는 자체 벤치마크이며, HLE 판정에는 GPT-4o를 사용함
각 행의 최고 결과는 굵게 표시했고
--는 결과가 아직 없거나 적용할 수 없다는 뜻임
비전-언어 성능
Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus4.6 Max | |
|---|---|---|---|---|---|
에이전트 멀티모달 지능 | |||||
컴퓨터 사용 OSWorld-Verified | 84.3 | 63.9 | 73.3 | 65.9 | 72.7 |
브라우저 사용 WebArena-Verified | 64.8 | 48.8 | 55.3 | -- | -- |
모바일 사용 AndroidWorld | 81.9 | 70.3 | 81.0 | -- | 62.0 |
애플리케이션 재현 RecreationBench | 47.1 | 29.8 | 30.2 | -- | -- |
멀티모달 도구 사용 ClawEval-MM | Pass@3 57.4, Average 56.9 | Pass@3 42.6, Average 50.4 | Pass@3 57.4, Average 60.1 | -- | Pass@3 52.5, Average 54.7 |
멀티모달 소프트웨어 엔지니어링 SWE-MM | 38.6 | 25.7 | 30.0 | -- | 27.1 |
시각적 웹 개발 Vision2Web | 62.9 | 45.0 | 42.1 | -- | -- |
일반 멀티모달 지능 | |||||
시각 수학 문제 풀이 MathVision | Without CI 90.0, With CI 94.6 | Without CI 85.1 | Without CI 90.3 | -- | Without CI 65.5 |
일반 시각 추론 BabyVision | Without CI 65.7, With CI 85.6 | Without CI 28.9 | Without CI 64.7, With CI 70.4 | -- | Without CI 12.6 |
과학 차트 분석 CharXiv (RQ) | Without CI 83.7, With CI 90.2 | Without CI 78.4 | Without CI 85.8, With CI 85.9 | 78.8 | Without CI 66.0 |
문서 지능 OmniDocBench 1.5 | 91.1 | 89.4 | 91.4 | 75.8 | 86.6 |
현실 세계 인식 RealWorldQA | 85.9 | 84.1 | 86.9 | -- | 73.9 |
체화 지능 ERQA | 65.5 | 62.5 | 69.8 | -- | 40.8 |
에이전트 멀티모달 지표에서는 Qwen3.8-27B가 모든 항목에서 단독 또는 공동 최고 Pass@3를 기록함
일반 멀티모달 영역에서는 CI 사용 시 MathVision 94.6, BabyVision 85.6, CharXiv (RQ) 90.2로 최고였지만, OmniDocBench 1.5·RealWorldQA·ERQA에서는 Qwen3.7-Plus가 앞섰음
MathVision·BabyVision·CharXiv (RQ)는 가능한 경우
Without CI와With CI를 따로 보고했고, 한 설정만 있으면 해당 결과만 표시함MathVision과 CharXiv (RQ)의 잘못된 정답 annotation 일부를 수동 검증 후 수정했으며, 표의 관련 점수는 수정된 annotation으로 다시 계산함
Qwen3.8-27B의 MathVision에는
Please reason step by step, and put your final answer within \boxed{}.라는 고정 prompt를 사용했고, 다른 모델은\boxed{}형식 요구가 있는 prompt와 없는 prompt 중 더 높은 점수를 채택함
WebArena-Verified는 OSWorld scaffold에서 공식 grader로 계산했고, RecreationBench는 Ubuntu·macOS·Windows 데스크톱, Android 모바일, 웹의 5개 플랫폼에 걸친 장기 애플리케이션 재현 능력을 측정하는 자체 벤치마크임
ClawEval-MM의 Pass@3는 세 번의 시도 중 한 번 이상 통과한 작업의 비율이고 Average는 세 번의 평균 점수임
Vision2Web은 frontend·webpage·website 범주의 평균으로, Claude Code harness에서 평가하고
gpt-5.4-2026-03-05로 판정함SWE-MM은 Claude Code harness에서 SWE-bench Multimodal의 공개 dev split과 Claude Opus 4.7 system card 부록 8.3의 변경 사항을 적용해 평가했으며,
--는 결과가 아직 없거나 적용 불가함을 나타냄
빠른 시작과 API
간편한 통합에는 API 사용을 권장하며, 직접 배포할 때는 최신 추론 프레임워크가 필요함
추론 효율과 처리량은 프레임워크에 따라 크게 달라짐. 최적의 성능과 호환성을 위해 최신 버전을 사용하고, 프로덕션 또는 고처리량 환경에는 SGLang, vLLM, TokenSpeed 같은 전용 serving engine을 권장함
Qwen3.8은 널리 쓰이는 추론 프레임워크로 배포할 수 있음
Qwen3.8 모델은 기본적으로 사고 모드로 동작하며, 최종 응답 전에
<think>\n...</think>\n\n으로 표시되는 사고 내용을 생성함. 사고 내용을 끄고 바로 응답받으려면 아래 예시와 같이 설정할 수 있음 생성 시 다음 sampling parameter 조합을 권장함
사고 모드:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0Instruct 또는 비사고 모드:
temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0지원되는 sampling parameter는 추론 프레임워크마다 다름
reasoning_effort로 추론 깊이와 비용을 조절할 수 있음xhigh가 기본값이며 철저한 분석이 필요한 복잡한 작업에 적합하고,medium은 정확도와 속도의 균형,low는 속도와 비용을 우선하는 효율적 추론에 맞춰짐preserve_thinking은 모든 workload에서 기본 활성화되어 이전 대화의 사고 블록을 유지함
여러 turn에 걸친 에이전트 작업에서는 낮은 reasoning effort가 전체 완료 시간을 항상 줄이지 않음. turn별 응답은 빨라질 수 있지만 분석 부족으로 실패와 재시도가 늘어 총 latency와 token 소비가 오히려 증가할 수 있음
권장 설정
반복을 줄이려면 지원되는 프레임워크에서
presence_penalty를 0~2 사이로 조정 가능함사고 모드와 비사고 모드의 권장 sampling parameter는 위 조합과 동일함
값을 높이면 무한 반복을 줄일 수 있지만 때때로 언어가 섞이거나 모델 성능이 소폭 떨어질 수 있음
에이전트 작업에는 상세한 추론과 최종 응답을 생성할 만큼 충분한 출력 길이를 배정해야 함
내부 추론과 최종 출력의 token limit를 따로 지원하는 프레임워크에서는 1M 컨텍스트 안에서 reasoning content 최대 262,144 tokens, final response 최대 131,072 tokens를 권장함
복잡한 추론에 필요한 용량을 확보하면서도 완성도 높은 최종 결과를 위한 공간을 남기는 설정임
입력과 출력을 합친 길이가 네이티브 한도 262,144 tokens를 넘는 장기 작업에는 YaRN 같은 RoPE scaling을 권장함
vLLM, SGLang, TokenSpeed 등에서 모델 설정 파일을 수정하거나 command line argument를 전달하는 두 방식으로 YaRN을 활성화할 수 있음
수 시간 분량 동영상의 frame sampling rate를 높이려면 전처리 설정을 조정해야 함
공개된
video_preprocessor_config.json의size는 일반 텍스트와 이미지 추론 효율을 위해 보수적으로 설정되어 있음longest_edge를 469,762,048로 설정하면 224k video tokens에 해당하는 더 높은 frame rate sampling을 활성화해 장시간 동영상 성능을 높일 수 있음
source https://huggingface.co/Qwen/Qwen3.8-27B-FP8
HN에서는 Qwen 3.8 27B가 개인용 장비에서 돌릴 수 있는 모델의 성능 기준을 높였다는 기대와, 벤치마크 수치를 실무 능력으로 곧바로 받아들이기 어렵다는 경계가 함께 나왔다. 비공개 추론 과제를 풀고, 이미지로 웹 화면을 구현하거나 모호한 요구만으로 작업을 끝까지 수행했다는 사례는 인상적이었다. 그러나 선도 모델과 대등하다는 평가는 독립적인 비교와 다양한 작업에서 다시 확인해야 한다는 반응도 적지 않았다.
실사용에서 더 중요한 기준은 정답률보다 시간과 자원이었다. 기본 추론 강도가 매우 높아 간단한 결과에도 많은 토큰과 긴 시간이 들었다. 긴 문맥에서는 VRAM 사용량과 처리 속도가 불리해져, 같은 장비라면 더 큰 문맥을 다루는 다른 모델이 낫다는 비교도 나왔다. 추론 강도를 낮추면 속도는 개선할 수 있지만 결과 품질이 함께 떨어질 수 있다.
체감 성능은 구동 환경에 따라서도 크게 달라졌다. GPU와 VRAM, 양자화 파일, llama.cpp 설정, MTP 적용 여부에 따라 처리량과 추론 반복 문제가 엇갈렸다. 채팅 템플릿이 사고 모드 전환이나 도구 호출, KV 캐시를 제대로 처리하지 못한다는 지적도 있었다. 특정 양자화본에서만 반복 문제가 나타났다는 경험을 보면, 초기 평가는 모델과 실행 도구를 나눠 살펴야 한다.
도입 여부는 벤치마크 순위보다 실제 작업에서 지시와 출력 형식을 끝까지 지키는지, 도구를 안정적으로 호출하는지, 필요한 문맥을 감당하며 허용 시간 안에 답하는지로 판단해야 한다. 로컬 실행의 비용과 통제권이 중요하다면 매력적이지만, 장문 작업이나 반복 개발에서는 더 빠른 MoE 모델이나 API를 역할별로 조합하는 방식도 현실적이다. 실제 저장소와 프롬프트로 먼저 시험하고 추론 예산, 양자화, 실행 엔진을 함께 조정해야 한다.
