에디블로그
Engineer's Field Notes

AI 자동화로 매일
한 편씩 쓰는
엔지니어 운영 노트

Claude Code · 자동화 파이프라인 · 사고 회고까지. 잘 굴러간 기록 + 깨진 흔적도 같이 남깁니다.

사람이 할 수 있는 일은,
AI도 할 수 있어야 합니다.
매일 한 편 쓰면서 검증 중.
— 이번 주 가장 많이 읽힌 글 TOP 3
AI/정보

[DeepSeek] V4 Flash 정식 공개, 코딩 에이전트 점수가 확 올랐어요

반응형
[DeepSeek] V4 Flash 정식 공개, 코딩 에이전트 점수가 확 올랐어요

[DeepSeek] V4 Flash 정식 공개, 코딩 에이전트 점수가 확 올랐어요

DeepSeek이 7월 31일 V4 Flash를 프리뷰에서 정식 릴리즈(공개 베타)로 전환했어요. 체크포인트 이름은 DeepSeek-V4-Flash-0731이고, 코딩 에이전트와 tool use 성능을 집중적으로 올린 업데이트예요.

01. 새 모델이 아니라 같은 모델의 재훈련이에요

아키텍처와 파라미터 수는 프리뷰 버전과 같아요. 포스트트레이닝만 다시 한 체크포인트라서, 기존에 deepseek-v4-flash를 쓰던 코드는 호출 방법을 바꿀 게 없어요.

이번 릴리즈에서 Responses API 포맷 지원이 추가됐어요. 멀티스텝 작업을 시키는 에이전트 앱을 만들 때 쓰는 포맷이에요. 상위 모델인 v4-pro는 아직 미지원이고, 8월 초 지원 예정으로 알려져 있어요.

02. Terminal-Bench가 61.8에서 82.7로 뛰었다고 해요

DeepSeek 발표 기준으로 Terminal-Bench 2.1 점수가 프리뷰 빌드 61.8에서 82.7로 올랐어요. 상위 모델인 V4-Pro-Preview의 72.1보다도 높은 점수예요.

DeepSWE 54.4, Toolathlon(verified) 70.3도 같이 실렸어요. Terminal-Bench 기준으로 보면 GLM-5.2의 81.0을 넘고 Claude Opus 4.8의 85.0에 가까운 수치인데, 모두 발표 자료 기준이라 실제 체감은 직접 써보고 판단할 부분이에요.

03. 출력 100만 토큰에 $0.28이에요

공식 가격 문서 기준으로 input은 cache hit $0.0028, cache miss $0.14, output은 $0.28이에요(100만 토큰당). v4-pro 가격의 대략 3분의 1 수준이에요. context window는 1M 토큰, 최대 출력은 384K 토큰이에요.

하나 알아둘 게 있어요. 공식 가격 문서 공지 기준으로 DeepSeek API에 조만간 피크/오프피크 요금제가 도입될 예정인데, 피크 시간에는 가격이 2배가 된다고 해요.

피크 시간 = 베이징 기준 9~12시, 14~18시. 한국시간으로는 10~13시, 15~19시라 한국 업무 시간과 거의 겹쳐요. 배치성 작업이라면 시간대를 피하는 쪽이 요금에 유리해요.

04. Claude Code에 그대로 꽂아 쓸 수 있어요

DeepSeek API는 OpenAI 호환 포맷과 Anthropic 호환 포맷을 둘 다 제공해요. Anthropic 포맷 엔드포인트(api.deepseek.com/anthropic)를 쓰면 Claude Code 같은 도구에 코드 수정 없이 연결된다고 공식 문서에 나와 있어요.

thinking mode, JSON output, tool call, context caching도 같이 지원해요. 에이전트 코딩 도구를 저비용 모델로 돌려보고 싶었다면 시도해볼 만한 선택지가 하나 늘어난 셈이에요.

출처: DeepSeek — DeepSeek-V4-Flash-0731 Release, DeepSeek API Pricing

이 글은 공식 발표 내용을 정리한 것이고, DeepSeek으로부터 어떤 형식의 협찬도 받지 않았습니다.

반응형

📚 같이 보면 좋은

"이 포스팅은 쿠팡 파트너스 활동의 일환으로, 일정액의 수수료를 제공받습니다."