딥시크가 V4-Flash 정식판 가중치를 MIT 라이선스로 공개했습니다. 4월 프리뷰를 대체하는 버전이며, 상업적 이용·수정·재배포가 가능한 형태입니다. API는 공개 베타로 제공되고 입력 가격은 100만 토큰당 0.14달러, 출력은 0.28달러입니다. 모델을 직접 내려받아 서버나 로컬 장비에서 실행하면 토큰 사용량에 따른 API 비용은 발생하지 않습니다.
이번 공개에서 중요한 부분은 단순히 가격이 싸다는 점이 아닙니다. 같은 규모와 구조를 유지하면서 코딩 에이전트, 터미널 조작, 도구 사용처럼 여러 단계를 거치는 작업의 성능을 크게 끌어올렸다는 데 있습니다. 다만 모든 영역에서 뛰어난 범용 모델이라기보다는 실행형 에이전트에 자원을 집중한 모델로 보는 편이 정확합니다.
Artificial Analysis 집계 기준 지능 지수는 4월 프리뷰의 40점에서 50점으로 상승했습니다. 이는 자료에서 비교한 Gemini 3.6 Flash와 같은 수준입니다. 아키텍처와 모델 크기, 가격은 프리뷰와 동일한 것으로 설명됐습니다.
세부 평가에서는 변화 폭이 더 큽니다. 코딩 에이전트 평가인 DeepSWE는 7.3점에서 54.4점으로 올랐고, 터미널 작업은 61.8점에서 82.7점이 됐습니다. 보안 취약점 발굴도 38.7점에서 76.7점으로 상승했습니다. 이런 과제는 답을 한 번 생성하고 끝나는 방식이 아니라, 명령을 실행하고 결과를 확인한 뒤 다음 행동을 결정해야 합니다.
딥시크가 강조한 변화는 모델 구조나 파라미터 수가 아니라 후반 학습입니다. 강화학습이나 온폴리시 증류처럼 실행 결과를 바탕으로 모델의 행동을 반복적으로 교정하는 과정이 중심입니다. 코드가 실행되는지, 명령이 성공했는지처럼 채점 기준이 비교적 분명한 작업에서는 일반적인 지식 문답보다 이런 학습 방식의 효과가 크게 나타날 수 있습니다.
자료에 따르면 V4-Flash는 한 번의 응답에서 실제로 켜지는 연산량이 13B 수준입니다. 반면 자사 상위 Pro 프리뷰는 49B를 사용했지만, 실행형 과제에서는 Flash가 모든 항목에서 앞선 것으로 소개됐습니다. 이는 파라미터 수가 작아도 학습 과정에서 더 많은 시행착오를 경험하고, 결과를 정확하게 평가하면 특정 업무에서 성능을 높일 수 있다는 사례로 해석할 수 있습니다.
이를 가능하게 한 기반은 재현 가능한 학습 환경입니다. GPU는 연산 순서에 따라 소수점 아래 값이 달라질 수 있고, 긴 추론에서는 이 차이가 누적될 수 있습니다. 딥시크는 학습과 추론 결과를 비트 단위로 일치시키기 위해 엔비디아 표준 라이브러리 대신 자체 GPU 커널을 구현했습니다. 일부 속도 최적화를 포기하더라도 같은 조건에서 같은 결과를 재현하는 쪽을 택한 것입니다.
또 하나는 샌드박스 클러스터입니다. 함수 호출, 컨테이너, 경량 가상머신 등 여러 실행 방식을 하나의 도구로 묶고, 수십만 개 환경의 실행 기록을 저장합니다. 학습 중 작업이 중단되면 기록을 재생해 중단 지점부터 이어갈 수 있습니다. 결제나 파일 삭제처럼 한 번만 실행돼야 하는 작업이 재시작 과정에서 중복되는 문제도 줄일 수 있습니다.
개별 기술 자체가 완전히 새로운 것은 아닙니다. 차별점은 이를 강화학습 파이프라인에 직접 연결하고, 대규모 환경에서 동시에 운영했다는 데 있습니다. 커뮤니티에서는 GPU 한 장이 초당 약 1만 8천 토큰을 생성하고, 두 개 클러스터가 하루 25조 토큰 규모의 실행 기록을 만들 수 있다는 추정도 나왔지만, 이는 공식적으로 확인된 수치가 아니라 추정치로 봐야 합니다.
출력 가격만 보면 딥시크는 100만 토큰당 0.28달러입니다. 자료에서 비교한 구글 모델의 출력 단가 7.50달러와 비교하면 약 27배 낮습니다. 반복적으로 코드를 실행하고 결과를 다시 모델에 보내는 에이전트 작업에서는 출력 토큰이 빠르게 늘어나므로, 이 차이는 일반적인 일회성 질의보다 더 크게 작용할 수 있습니다.
캐시 입력 가격은 100만 토큰당 0.0028달러로 제시됐습니다. 에이전트는 프로젝트 구조, 규칙 파일, 이전 실행 결과처럼 반복해서 참조하는 문맥이 많기 때문에 캐시 가격이 낮으면 장시간 작업의 비용을 줄이는 데 도움이 됩니다. 다만 실제 비용은 모델이 몇 단계까지 실행하는지, 실패 후 재시도하는지, 입력 문맥이 얼마나 커지는지에 따라 달라집니다.
가중치 공개는 비용 구조를 더 크게 바꿉니다. 모델을 직접 배포하면 API 호출료 대신 GPU·전력·스토리지·운영 비용을 부담합니다. 따라서 ‘무료 모델’은 ‘무료 컴퓨팅’을 뜻하지 않습니다. 소규모 테스트라면 공개 엔드포인트나 저렴한 API가 편할 수 있고, 장시간 자동화나 민감한 코드 처리처럼 사용량이 일정하게 크다면 자체 배포가 유리할 가능성이 있습니다.
공개 당일 4비트 양자화 버전도 제공됐습니다. 안내 기준으로 램 168GB에서는 무손실 4비트, 110GB에서는 3비트 실행이 가능합니다. V4-Flash 기본 배포본은 별도 압축 없이 약 167GB로 소개됐습니다.
따라서 일반적인 게이밍 PC나 노트북에서 바로 실행하는 모델은 아닙니다. 모델 파일을 저장할 디스크 공간뿐 아니라 추론 중 필요한 메모리, 운영체제와 추론 엔진의 오버헤드까지 고려해야 합니다. 양자화는 메모리 요구량을 낮추지만 정밀도와 속도, 출력 품질에 영향을 줄 수 있으므로 배포 전에 실제 작업으로 검증하는 편이 안전합니다.
vLLM은 V4 계열 최적화를 미리 반영해 두었고, 기존 서빙 설정을 사용할 수 있다고 전해졌습니다. 추측 디코딩도 옵션을 켜는 방식으로 적용할 수 있습니다. 다만 새로 추가된 신뢰도 헤드는 아직 로더 지원이 완전하지 않다고 하므로, 모든 기능이 공개 직후 동일하게 작동한다고 기대해서는 안 됩니다.
공식 벤치마크는 딥시크가 공개한 실행 환경의 최소 구성에서 측정됐습니다. 명령 실행과 파일 편집 두 도구만 제공하고 최대 500단계까지 수행하는 조건이며, 풀스택 개발 68.7점과 코딩 난제 59.6점은 내부 테스트셋 결과입니다. 실제 서비스에서 사용하는 도구 수, 컨텍스트 관리 방식, 단계 제한이 다르면 결과도 달라질 수 있습니다.
외부 평가도 공개 하루 만에 일부 나왔습니다. 독립 벤치마크에서 종합 지수 50을 기록했고, 제3자 보안 평가에서는 32개 취약점 가운데 24개를 찾았다는 내용이 있습니다. 하지만 같은 평가에서도 과제를 끝내는 비용은 가격을 낮춘 Luna보다 약 두 배였다고 합니다. 성능 점수만 보고 가장 저렴한 모델이라고 판단하면 안 되고, 성공률과 재시도 횟수까지 포함한 작업당 비용을 봐야 합니다.
V4-Flash에는 이미지 입력이 없습니다. 화면을 직접 읽어야 하는 작업은 별도 비전 모델을 붙여야 합니다. 물리 추론과 초장문 문맥 추론 일부에서도 다른 모델보다 낮은 평가가 나왔습니다. 코딩 에이전트에는 적합할 수 있지만 이미지 분석, 복잡한 물리 문제, 긴 문서의 정밀한 추론이 핵심인 업무라면 별도 비교가 필요합니다.
딥시크가 모델을 무료로 공개한 배경은 모델 파일 자체보다 이를 만들어내는 학습 공장에 경쟁력이 있다고 보기 때문으로 해석할 수 있습니다. 5월 유출 회의록을 근거로 한 자료에서는 장비 투자비를 약 열 달 안에 회수하는 가격 전략과, 앞으로 이익률을 더 낮출 수 있다는 관점이 언급됐습니다.
이 전략에서는 특정 모델을 독점 판매하는 것보다 자사 모델을 업계의 기본 선택지로 만드는 편이 유리할 수 있습니다. 실제로 공개 직후 허깅페이스에 무료 엔드포인트가 등장했고, 여러 오픈 모델을 묶은 월 9.99달러 코딩 에이전트 서비스도 나왔습니다. 모델 공개와 서빙 생태계 확장이 동시에 진행된 셈입니다.
다만 비용 경쟁의 다음 변수는 전력과 인프라입니다. 블룸버그 보도에 따르면 딥시크는 중국 내몽골 울란차부에 1GW 규모 데이터센터를 준비 중이며, 일부 시설은 2027년 말에서 2028년 초 가동을 목표로 합니다. 어떤 칩을 사용할지는 공개되지 않았습니다. 효율이 좋아져도 연산 수요가 사라지는 것이 아니라, 절약한 비용으로 더 많은 학습과 추론을 수행하려는 방향으로 이어질 수 있습니다.
V4-Flash를 선택할 때는 모델 가격만 보지 말고 작업의 성격을 먼저 확인해야 합니다. 코드 수정과 터미널 자동화처럼 실행 결과로 성공 여부를 판단할 수 있는 업무라면 낮은 토큰 비용과 에이전트 성능이 매력적입니다. 반대로 이미지 입력이나 고난도 장문 추론이 필요하거나, 로컬 장비에 110GB 이상의 메모리를 확보하기 어렵다면 API 또는 다른 모델이 더 현실적인 선택일 수 있습니다. 앞으로는 V4-Pro 정식판의 교사 모델 성능과 실제 서빙 환경에서의 작업당 비용이 이 모델의 장기적인 가치를 가늠할 핵심 기준이 될 것입니다.
딥시크가 V4-Flash 정식판의 가중치를 MIT 라이선스로 공개했습니다. 입력 100만 토큰당 0.14달러, 출력 0.28달러이며 직접 배포하면 API 비용이 없습니다. 코딩·터미널·도구 사용 성능은 크게 올랐지만 이미지 입력과 일부 추론 능력은 제한적이고, 로컬 실행에는 110~168GB급 메모리가 필요합니다.