긍정 · 복잡한 퍼즐 풀이 사례
중국·영국·일본 탐정과 ITU 국가번호를 연결해 #864481을 도출한 긴 추론 결과를 공유했다. 단일 사용 사례이며 정식 품질 평가가 아니다.
01API 토큰 가격은 비교군 최저다. 캐시 미스 입력 $0.14, 출력 $0.28/1M 토큰이며 캐시 히트 입력은 $0.0028이다.
02독립 평가에서 AA Intelligence Index 50을 기록했지만 출력 속도는 아직 N/A이고, 210M 토큰을 쓴 매우 장황한 설정이었다.
03대량 에이전트·코딩 초벌에 우선 투입하되 고난도 최종 판단, 한국어 품질, 개인정보·벤더 리스크는 별도 검수해야 한다.
DeepSeek-V4-Flash-0731을 가격표만으로 판단하지 않고, 1M 컨텍스트·384K 최대 출력, 도구/API 지원, 독립 평가, 경쟁 모델 단가와 실제 사용자 반응까지 같은 기준으로 정리했습니다.
V4 Flash는 저가 실험용 이상이다. 1M 컨텍스트·384K 출력, thinking, JSON·도구 호출·Responses API를 갖췄다. 단, 가격 우위가 모든 업무의 품질 우위는 아니다.
| 입력(캐시 미스) | $0.14 / 1M |
|---|---|
| 입력(캐시 히트) | $0.0028 / 1M |
| 출력 | $0.28 / 1M |
| 컨텍스트 / 출력 | 1M / 384K |
출력 단가는 V4 Pro의 1/3.1, GPT-5.6 Luna의 1/4.3, Gemini 3.6 Flash의 1/26.8, Claude Sonnet 5 도입가의 1/35.7 수준이다.
Artificial Analysis: Intelligence Index 50, 동급 #3/101. 다만 210M 출력 토큰을 썼고 속도는 N/A라 운영 효율은 미확인이다.

‘싼 모델’이 아니라, 비용·지능·운영 리스크가 비대칭인 모델로 봐야 합니다.
DeepSeek V4 Flash의 가장 강한 객관적 장점은 가격과 긴 출력 한도다. 캐시 미스 입력 $0.14와 출력 $0.28은 최신 상용 고속·균형형 모델보다 현저히 낮고, 1M 컨텍스트와 384K 최대 출력은 장기 에이전트 작업에 유리하다.
독립 성능 신호도 약하지 않다. Artificial Analysis의 reasoning/max-effort 설정은 Intelligence Index 50으로 동급 상위권을 표시한다. 그러나 이 평가는 매우 많은 출력 토큰을 사용했고 실제 API 출력 속도는 게시되지 않았다. 따라서 벤치마크 점수만으로 실서비스 비용·지연·안정성을 확정하면 안 된다.
직접 경쟁군은 DeepSeek V4 Pro, GPT-5.6 Luna·Terra, Gemini 3.6 Flash, Claude Sonnet 5로 잡았다. 모두 현재 공식 API 문서에서 확인되는 최신 고속·균형형 또는 비용 최적화 모델이다. 각 공급자의 벤치마크와 도구 체계가 달라 성능 점수를 억지로 한 줄로 합치지 않았다.
USD/1M 토큰 표준 API 정가. 캐시·장문·도구·검색·우선 처리 요금은 별도 조건입니다.
| 모델 | 입력 / 출력 | 캐시 입력 | 컨텍스트 / 최대 출력 | 입력 형식·핵심 기능 | 판단 |
|---|---|---|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 | $0.0028 | 1M / 384K | 텍스트 · thinking · JSON · Tool Calls · Responses API | 최저가 대량 에이전트 |
| DeepSeek V4 Pro | $0.435 / $0.87 | $0.003625 | 1M / 384K | 텍스트 · thinking · JSON · Tool Calls · Anthropic API | DeepSeek 내 고성능형 |
| GPT-5.6 Luna | $0.20 / $1.20 | $0.02 | 1.05M / 128K | 텍스트·이미지 · Responses · Web/File/Computer tools | OpenAI 비용 최적화 |
| GPT-5.6 Terra | $2.00 / $12.00 | $0.20 | 1.05M / 128K | 텍스트·이미지 · Responses · 폭넓은 hosted tools | 지능·생태계 균형 |
| Gemini 3.6 Flash | $1.50 / $7.50 | $0.15 | 1,048,576 / 65,536 | 텍스트·이미지·영상·오디오·PDF · Search/Maps grounding | 멀티모달·검색 강점 |
| Claude Sonnet 5 | $2.00 / $10.00* | 공식 캐시 조건 별도 | 1M / 128K | 텍스트·이미지 · adaptive thinking · 주요 클라우드 제공 | 고난도 균형형 |
* Claude Sonnet 5는 2026-08-31까지 도입가 $2/$10, 이후 공식 표준가는 $3/$15. DeepSeek는 향후 UTC+8 기준 피크 시간에 모든 항목 2배 요금 정책을 예고했지만 시행일은 별도 공지 예정.
| V4 Flash 대비 | 입력 단가 배수 | 출력 단가 배수 | 해석 |
|---|---|---|---|
| V4 Pro | 3.1× | 3.1× | 같은 DeepSeek 계열 내 품질 프리미엄 |
| GPT-5.6 Luna | 1.4× | 4.3× | 입력은 근접, 장문 출력은 차이 확대 |
| Gemini 3.6 Flash | 10.7× | 26.8× | 멀티모달·검색 기능 비용 포함 판단 필요 |
| Claude Sonnet 5 도입가 | 14.3× | 35.7× | 고난도 품질·엔터프라이즈 체계와 교환 |
단일 승자보다 라우팅 전략이 경제적입니다.
코드 초안, 에이전트 반복, 긴 로그 분석, 검색 결과 정리, 대량 분류·추출. 실패 비용이 낮고 호출량이 많은 작업.
최종 의사결정, 보안·법률·재무, 복잡한 한국어, 모호한 요구사항, 대외 공개물. V4 Flash의 불확실성·자기모순·재시도가 감지되면 승격.
영상·오디오·PDF·검색 grounding이 중심이면 Gemini 3.6 Flash. OpenAI hosted tools·computer use가 핵심이면 GPT-5.6 계열.
최종 결론: V4 Flash는 가격 때문에만 고르는 모델이 아니라, 독립 지능 신호까지 고려할 때 대량 에이전트용 1차 엔진으로 충분히 시험할 가치가 있다. 다만 전면 교체보다 7일 파일럿 후 실제 업무 성공률과 총비용으로 판단하는 것이 안전하다.
공급자 자기평가와 독립 실측을 분리했습니다.
이 수치는 reasoning/max-effort 설정의 독립 평가다. 경쟁 모델과 프롬프트·추론 예산·호스팅 조건이 완전히 같다고 가정하지 않는다.
도입 비용보다 실패 비용과 데이터 조건을 먼저 확인합니다.
공개 근거가 충분하지 않은 부분은 결론에서 제외했습니다.
X·Threads·블로그·커뮤니티·뉴스에서 실제로 확인한 의견을 긍정·우려·조건부 평가로 나눴습니다.
중국·영국·일본 탐정과 ITU 국가번호를 연결해 #864481을 도출한 긴 추론 결과를 공유했다. 단일 사용 사례이며 정식 품질 평가가 아니다.
32GB RAM 같은 평균적 하드웨어에서 돌릴 수 있는 더 작은 V4 계열을 요청했다. 오픈 웨이트의 접근성과 실제 셀프호스팅 난이도가 다름을 보여준다.
공개 원문 보기2× RTX Pro 6000, 192GB VRAM 구성에서 DeepGEMM의 Unsupported architecture 오류를 보고했다. 이후 커뮤니티 패치가 공유됐지만 공식 지원 대기 의견도 있었다.
공개 원문 보기V4 Flash와 V3.2의 차이를 묻는 토론이 이어졌다. 빠른 릴리스와 별칭 갱신은 모델 고정(snapshot)·회귀 테스트 필요성을 높인다.
공개 원문 보기온라인 의견은 대표 표본이며 전체 여론을 뜻하지 않습니다. 작성자·매체·게시일·원문 링크는 아래 전체 출처에 함께 기록했습니다.
사실·분석·전망·루머·온라인 반응, 시각자료와 생성 이미지의 상태를 함께 기록했습니다.
| 유형 | 자료명 | 제공자·저작자 | 원문 | 날짜 | 라이선스·상태 | 사용 범위 |
|---|---|---|---|---|---|---|
| 공식 사양 | Models & Pricing | DeepSeek | 원문 | 확인 2026-08-03 | 공식 문서·공개 | 가격·컨텍스트·기능 |
| 공식 발표 | DeepSeek 공식 홈 V4 Flash 공지 | DeepSeek | 원문 | 확인 2026-08-03 | 공식 공지·공개 | 공개 베타·Agent 개선 주장 |
| 공식 발표 | DeepSeek V4 Preview Release | DeepSeek | 원문 | 2026-04-24 | 공식 발표·공개 | 구조·벤치마크 배경 |
| 모델 카드 | DeepSeek-V4-Flash | deepseek-ai / Hugging Face | 원문 | 확인 2026-08-03 | MIT 모델 라이선스·공개 | 파라미터·오픈 웨이트 |
| 독립 평가 | DeepSeek V4 Flash 0731 (max) | Artificial Analysis | 원문 | 2026-07 | 독립 평가·공개 | Intelligence Index·비용 |
| 공식 사양 | GPT-5.6 Luna | OpenAI | 원문 | 확인 2026-08-03 | 공식 문서·공개 | 가격·컨텍스트·도구 |
| 공식 사양 | GPT-5.6 Terra | OpenAI | 원문 | 확인 2026-08-03 | 공식 문서·공개 | 가격·컨텍스트·도구 |
| 공식 사양 | Claude Models Overview | Anthropic | 원문 | 확인 2026-08-03 | 공식 문서·공개 | Sonnet 5 가격·사양 |
| 공식 가격 | Gemini Developer API Pricing | 원문 | 확인 2026-08-03 | 공식 문서·공개 | Gemini 3.6 Flash 가격 | |
| 공식 사양 | Gemini 3.6 Flash | 원문 | 2026-07 | 공식 문서·CC BY 4.0 텍스트 | 입출력·기능·컨텍스트 | |
| 정책 | DeepSeek 개인정보 처리방침 | DeepSeek | 원문 | 2026-05-06 | 공식 한국어 정책·공개 | 데이터 처리·국외이전 |
| 공개 반응 | 퍼즐 풀이 사용 사례 | Mephisto1484 / Hugging Face | 원문 | 2026-05-15 | 사용자 게시물·인용 요약 | 긍정 사례 |
| 공개 반응 | Too big to run locally | Dampfinchen / Hugging Face | 원문 | 2026-04-24 | 사용자 게시물·인용 요약 | 셀프호스팅 한계 |
| 공개 반응 | 2× RTX Pro 6000 실행 문제 | stev236 / Hugging Face | 원문 | 2026-04-24 | 사용자 게시물·인용 요약 | GPU 호환성 |
| 공개 반응 | V4 Flash vs V3.2 혼선 | MateoTeo / Hugging Face | 원문 | 2026-06-03 | 사용자 게시물·인용 요약 | 버전 포지셔닝 |
| 시각자료 | DeepSeek API Docs favicon | DeepSeek | 원문 | 확인 2026-08-03 | 상표권 유보·출처 식별 목적 | 인포그래픽 내 소형 식별 아이콘 |