주간 AI 동향 — 8월 셋째 주
- AI동향
- 주간다이제스트
- AI보안
- AI거버넌스
- AI비용
- AI에이전트
- 오픈모델
이 코너는 한 주의 AI 소식을 전부 나르지 않습니다. 기업 현장의 일하는 방식에 영향을 주는 것만 골라, 소식마다 저의 현장 관점을 하나씩 붙입니다.
8월 셋째 주(2026-08-10 ~ 08-16)는 다섯 건을 골랐습니다. 지난주에는 경계를 정하는 손이 서로 반대로 움직인다고 썼습니다. 이번 주는 그 다음 질문입니다 — 그어 둔 경계가 정말 우리가 생각하는 일을 하고 있는가.
다섯 건이 각각 다른 방향에서 같은 답을 냈습니다. 오픈AI는 보안 안전장치를 걷어낸 모델을 심사 통과자에게 열었는데 완료율이 1.5%에서 2.0%로 올랐을 뿐이었고(①), 앤트로픽은 막는 대신 전부 기록해 뽑아가는 쪽으로 갔고(②), 같은 날 구글과 오픈AI는 값과 속도의 기준선을 3주 만에 갈아치웠고(③), 제미나이 앱은 10억 명을 넘겼는데 그 사용의 63%는 타자가 아니라 말이었습니다(④). 그리고 중국 쪽 두 건이 앞의 축을 그대로 되받았습니다 — 딥시크는 값을 시간에 묶었고, Z.ai는 오픈 가중치 공개를 처음으로 미뤘습니다(⑤).
이번 주 빼기로 한 것들.
가장 크게 걸릴 뻔한 건 “챗GPT 광고가 한국에도 들어왔다”입니다. 8월 11일 오픈AI가 공식 페이지를 업데이트하면서 영국·멕시코·브라질·일본·한국을 함께 나열했고, 국내 매체 여러 곳이 이걸 “한국 시범 도입”으로 받았습니다. 그런데 국내 파일럿은 이미 6월 19일에 시작됐습니다. 전자신문·인공지능신문 등이 그때 이미 “무료·고(Go) 요금제 대상 광고 노출 시작”으로 보도했고요. 이번 주에 새로 켜진 시장은 브라질과 멕시코입니다. 나열된 국가 목록은 그때까지 누적된 목록이었습니다. 낡은 정보는 티가 안 난다고 쓴 그 함정을 두 주 연속 만났습니다.
오픈AI가 미출시 모델 Astra의 작업 일부를 중단한 건(8월 7일)은 지난 구간 사건이라 단독 항목에서 뺐습니다. 대신 ①의 배경으로 씁니다 — 같은 회사가 사흘 사이에 반대로 움직였기 때문입니다.
마이크로소프트의 에이전트 관리 기능(멀티테넌트 관리 공개 미리보기, 에이전트 다중 소유자)은 롤아웃이 “8월 초~중순”으로만 걸려 있고 특정 날짜를 1차 문서에서 확정하지 못해 뺐습니다. 국내 소식은 이번 구간에서 일하는 방식에 닿는 건을 찾지 못해 싣지 않았습니다. 건수를 채우려고 넣지 않습니다.
① 안전장치를 통째로 껐더니, 1.5%가 2.0%가 됐습니다
무슨 일이 있었나. 8월 10일, 오픈AI가 자사 사이버 방어 프로그램 데이브레이크(Daybreak)를 두 층으로 나눴습니다.
- 블루(Blue): 승인된 방어자에게 GPT-5.6 Sol 같은 범용 프런티어 모델을 주되, 보안 관련 요청을 걸러내던 시스템 수준 안전장치를 제거한 상태로 제공합니다. 오픈AI는 대부분의 방어자에게 여기서 시작하라고 권합니다. 다만 운영 중인 시스템에 대한 침투 테스트처럼 이중용도성이 높은 요청은 여전히 거절합니다.
- 레드(Red): 보안 전용으로 훈련된 모델(GPT-5.5-Cyber, 그리고 이번에 나온 GPT-5.6-Cyber)에 접근합니다. 신원 확인, 법적 확약, 승인된 용도가 필요하고, 초기에는 액센츄어·IBM·크라우드스트라이크·클라우드플레어 같은 신뢰 파트너에게만 열렸습니다.
여기서 이번 주에 가장 오래 남을 숫자가 나옵니다. 오픈AI 내부 평가(고급 사이버보안 완료율)에서 취약점 연쇄·권한 상승 같은 민감한 요청의 완료율은 이렇습니다.
| 무엇을 쓰는가 | 완료율 |
|---|---|
| 일반 GPT-5.6 Sol | 1.5% |
| 안전장치를 제거한 GPT-5.6 Sol (블루) | 2.0% |
| GPT-5.5-Cyber | 57.3% |
| GPT-5.6-Cyber (레드) | 95.0% |
오픈AI는 이 모델로 크롬의 자바스크립트 엔진 V8에서 알려지지 않은 취약점 두 개를 찾아냈고, 구글이 패치했습니다(CVE-2026-15903).
배경을 같이 봐야 합니다. 사흘 전인 8월 7일, 오픈AI는 아직 내놓지 않은 모델 Astra가 사이버 능력에서 ‘심각(Critical)’ 기준을 넘었을 가능성을 배제할 수 없다며 일부 작업을 멈추고 추가 검증에 들어간다고 밝혔습니다. 사흘 사이에 한쪽에서는 “위험해서 멈춘다”, 다른 쪽에서는 “심사를 통과하면 안전장치 없이 쓰게 해주겠다”가 나온 겁니다.
저는 이렇게 봅니다. 저 표의 첫 두 줄이 이번 주의 핵심입니다. 안전장치를 통째로 걷어냈는데 1.5%가 2.0%가 됐습니다. 우리가 흔히 갖는 직관 — “규정만 풀어주면 AI가 그걸 할 수 있게 된다” — 이 정면으로 반박됩니다. 실제 차이는 따로 훈련된 모델에서 났습니다. 2.0%와 95.0% 사이에 있는 건 허가가 아니라 훈련입니다.
이 구분이 현장에서 매일 헷갈립니다. 사내에서 “그건 보안 정책 때문에 AI로 못 합니다”라는 말이 나올 때, 실은 두 가지가 섞여 있습니다.
- 막혀서 못 하는 것 — 풀어주면 됩니다.
- 애초에 못 하는 것 — 풀어줘도 그대로입니다.
둘을 구분하지 않으면 두 방향 모두로 손해를 봅니다. 정책을 어렵게 풀어놓고 성과가 안 나거나, 반대로 “규정 때문”이라는 말 뒤에 능력 부족이 계속 숨습니다. 저는 이 구분을 확인하는 방법이 하나뿐이라고 봅니다 — 작은 범위에서 한 번 열어보고 결과를 재는 것입니다. 회의실에서는 이 둘이 절대 구분되지 않습니다.
그리고 반대편에 남는 사실이 하나 더 있습니다. 진짜 능력은 신원 확인과 용도 승인을 통과한 계정에만 열렸습니다. 성능표에는 “GPT-5.6-Cyber 95%“라고 적히지만, 그 숫자를 실제로 쓸 수 있느냐는 모델이 아니라 계약서와 심사가 정합니다. 앞으로 “이 모델이 뭘 할 수 있나”보다 “우리 계정으로 뭐가 열리나”를 먼저 봐야 하는 일이 늘어납니다.
한 가지 단서를 답니다. 위 숫자는 전부 오픈AI 자체 평가입니다. 외부에서 재현한 수치가 아닙니다.
② 에이전트에게 시킨 말이, 감사 자료로 통째로 뽑혀 나옵니다
무슨 일이 있었나. 8월 11일, 앤트로픽이 컴플라이언스 API의 적용 범위를 코웍(Cowork)과 클로드 코드(Claude Code)까지 넓혔습니다. 기존에는 일반 대화만 대상이었습니다. 이제 데스크톱·웹·모바일·CLI에서 일어난 세션을 하나의 API로 끌어올 수 있습니다.
무엇이 나오는지가 중요합니다. 내용 쪽은 프롬프트와 응답, 툴 호출의 내용(웹 검색·MCP), 스킬과 아티팩트의 내용까지 대화록 텍스트로 나옵니다. 메타데이터 쪽은 검증된 사용자·조직 ID, 이메일, 세션·메시지 ID, 타임스탬프입니다. 용도로 명시된 건 감사와 이디스커버리(eDiscovery, 소송 대비 전자증거 수집)입니다. 현재 클로드 엔터프라이즈 대상 베타이고, 이미 접근 키가 있는 조직은 바로 조회할 수 있습니다.
한 주 전(8월 6일)에는 클로드 코드 세션을 회사 자체 인프라에서 실행하는 기능이 퍼블릭 베타로 열렸습니다. 팀·엔터프라이즈 플랜 대상이고 기본은 꺼져 있습니다. 두 개를 붙여 놓으면 방향이 보입니다 — 실행은 우리 안으로, 기록은 밖으로 뽑아갈 수 있게.
저는 이렇게 봅니다. 회사가 AI를 다루는 수단이 금지에서 기록으로 옮겨가고 있습니다. 이건 후퇴가 아니라 현실 인식입니다. 막는 걸로는 안 된다는 걸 아는 조직이 다음으로 택하는 게 기록이니까요.
현장에서 이게 바꾸는 건 규정이 아니라 감각입니다. 많은 분이 AI 대화창을 아직 혼잣말하는 메모장처럼 씁니다. 초안을 던져보고, 아직 확정 안 된 숫자를 넣어보고, “이거 좀 이상한데 어떻게 둘러대지”까지 쳐 봅니다. 그런데 이제 그 창은 툴 호출 내역까지 붙은 업무 기록입니다. 나중에 뽑히는 건 최종 결과물이 아니라 거기까지 간 과정 전부입니다.
한 가지 더. 뽑히는 게 프롬프트만이 아니라 툴 호출과 아티팩트 내용까지라는 점이 실무적으로 큽니다. 에이전트가 무엇을 읽고 무엇을 건드렸는지가 남는다는 뜻이니까요. 제가 AI가 무엇을 보고 답했는지 아무도 알려주지 않는다고 썼던 그 빈칸을, 적어도 사후에는 메울 수 있게 됩니다.
물론 조건이 있습니다. 베타이고, 엔터프라이즈 대상이고, 조직이 실제로 API를 붙였을 때 이야기입니다. 기능이 있다는 것과 우리 회사가 그걸 쓰고 있다는 건 다릅니다. 지금 확인해 둘 건 하나입니다 — 우리가 쓰는 AI 도구는, 누가 무엇까지 뽑아갈 수 있게 되어 있습니까.
③ 같은 날, 값은 반으로 속도는 14배로 갔습니다
무슨 일이 있었나. 8월 13일 하루에 두 건이 나왔습니다.
구글 — 제미나이 3.7 플래시. 코딩과 에이전트용 주력 모델입니다. 도입가가 100만 토큰당 입력 0.75달러 / 출력 3.75달러이고, 이건 2026년 12월 31일까지의 도입가입니다. 내년 1월 1일부터는 1.50달러 / 7.50달러가 됩니다. 여기서 정확히 봐야 할 게 있습니다 — 인상되는 그 가격이 바로 전 모델(3.6 플래시)의 가격입니다. 즉 “반값”은 연말까지의 할인이고, 그 뒤에도 남는 건 같은 값에 더 나은 모델입니다.
성능 쪽은 구글 자체 발표 기준으로 실무 자동화 벤치마크는 17.0%에서 30.4%로, 장기 소프트웨어 과제는 49.0%에서 65.3%로 올랐습니다. 그리고 이 모델은 3.6 플래시가 나온 지 23일 만에 나왔습니다.
오픈AI — 울트라패스트(Ultrafast) 프리뷰. GPT-5.6 Sol을 세레브라스의 웨이퍼 스케일 하드웨어에서 돌려 초당 최대 750토큰을 냅니다. 표준 처리(초당 약 53토큰)의 최대 14배입니다. 다만 한정 프리뷰이고 대기자 명단이며, 가격도 정식 출시일도 공개되지 않았습니다.
저는 이렇게 봅니다. 이 두 건은 새 기능이 아니라 판정의 유통기한에 관한 소식입니다.
조직에는 어디에나 “AI로 해봤는데 안 되더라” 목록이 있습니다. 비싸서, 느려서, 품질이 안 나와서. 그런데 그 목록에는 대개 날짜가 안 적혀 있습니다. 한 번 내려진 판정은 회의록에 남고, 그 뒤로 갱신되지 않습니다. 반면 판정의 근거였던 조건은 23일 단위로 바뀝니다.
특히 실무 자동화 점수가 17%에서 30%로 간 건 그냥 벤치마크 숫자가 아닙니다. 작년에 “자동화하려다 자꾸 틀려서 접었다”는 그 업무들이 정확히 이 구간에 몰려 있습니다. 절반이 실패하던 게 셋 중 하나 실패로 바뀌면, 사람이 붙어서 검수하는 방식으로 넘어갈 수 있는 일이 생깁니다.
그래서 제 처방은 단순합니다. “안 되는 일 목록”에 날짜와 근거를 같이 적으십시오. “2026년 3월, 출력 품질 때문에 보류. 재검토 9월.” 이 두 줄이 없으면 그 목록은 영구 보관되고, 조직은 이미 풀린 문제를 계속 못 하는 일로 취급합니다. 제가 6개월 전에 쓴 지시가 오늘 AI를 방해한다고 쓴 것과 같은 이야기입니다. 낡는 건 지시만이 아니라 판정입니다.
속도 쪽도 같은 층위입니다. 초당 53토큰이면 사람이 기다립니다. 750토큰이면 기다림이 사라집니다. 그런데 기다림이 사라지면 일하는 방식이 바뀝니다 — 한 번 잘 시켜놓고 자리를 뜨는 대신, 대화하듯 붙어서 고쳐 나가게 됩니다. 다만 이건 아직 대기자 명단이고 값을 모릅니다. 값을 모르는 속도는 아직 계획에 넣을 수 없습니다.
④ 10억 명이 쓰는데, 그중 63%는 타자를 치지 않습니다
무슨 일이 있었나. 8월 11일, 구글이 제미나이 앱의 월 활성 사용자 10억 명 돌파를 발표했습니다. 구글 역사상 가장 빠르게 성장한 제품이고, 10억을 넘긴 14번째 제품입니다. 2025년 5월 4억, 2026년 5월 9억을 지나 왔습니다.
숫자 자체보다 사용 방식 쪽이 눈에 띕니다. 구글 발표 기준으로 사용자의 63%가 제미나이에게 직접 말을 겁니다. 제미나이 라이브에서는 약 5건 중 1건이 실시간 카메라나 화면 공유를 동반합니다. 하루에 이미지 1억 5천만 장이 만들어지고, 안드로이드에서는 40개 이상의 앱에 걸쳐 작업을 자동화하며, iOS 사용자만 1억 명이 넘습니다.
저는 이렇게 봅니다. 회사가 AI 사용을 관리한다고 할 때 실제로 관리하는 대상은 대개 세 가지입니다 — 계정, 설치, 업로드. 어떤 도구를 승인했고, 누가 로그인했고, 무슨 파일이 올라갔는가. 그런데 위 숫자가 말하는 실제 사용은 그 세 가지를 전부 비켜갑니다.
말로 묻고, 화면을 보여줍니다. 개인 휴대폰에서, 개인 계정으로, 회사 노트북 화면을 비추면서요. 파일은 한 번도 업로드되지 않습니다. 그러니 업로드 로그에는 아무것도 안 남습니다. 제가 답을 안 한 요청은 아무 데도 안 남는다고 쓴 것과 같은 구조입니다 — 기록이 없다는 건 일이 없었다는 뜻이 아닙니다.
②번과 나란히 놓으면 대비가 선명합니다. 회사가 승인한 도구에서는 툴 호출 내역까지 통째로 뽑혀 나오고, 개인 폰의 화면 공유에서는 아무것도 안 남습니다. 통제가 강해질수록, 통제되지 않는 경로가 편해집니다. 이건 직원들이 나빠서가 아니라 사람이 원래 그렇게 움직이기 때문입니다.
그래서 저는 “화면 공유 금지”라고 적는 걸 권하지 않습니다. 지킬 수 없는 금지는 서랍에서 잠자는 가이드라인이 될 뿐입니다. 대신 질문을 이렇게 바꾸시길 권합니다. 직원들이 개인 폰으로 화면을 비춰가며 물어보는 그 질문들은, 회사 도구에서는 왜 못 물어보고 있습니까. 대개 답은 셋 중 하나입니다 — 회사 도구가 못 하거나, 느리거나, 물어보면 혼날 것 같거나.
⑤ 중국 쪽 두 건 — 값은 시간에 묶였고, 오픈 가중치는 처음으로 늦춰졌습니다
무슨 일이 있었나 (1) — 딥시크 V4-Pro 정식 출시(8월 13일). 4월부터 프리뷰였던 플래그십이 정식(GA)으로 전환됐습니다(V4-Pro-0813). 앱·웹의 전문가 모드와 API에서 쓸 수 있고, 회사가 내세운 건 에이전트 성능입니다. 실무적으로 눈에 띄는 건 둘입니다. 추론 강도를 low·high·max로 골라 쓰게 했고(간단한 일엔 낮게, 복잡한 일엔 높게), 오픈AI의 Responses API를 네이티브로 지원합니다(코덱스 연동 최적화).
그리고 8월 16일 16시(UTC)부터 V4-Pro도 시간대별 과금에 편입됐습니다. 100만 토큰당 오프피크 입력 0.66달러 / 출력 1.98달러, 피크는 그 두 배(1.32 / 3.96달러)입니다. 5월부터 유지되던 단가가 0.435 / 0.87달러였으니 오프피크조차 오른 값입니다. 피크 구간은 UTC 0104시와 0610시 — 한국시간으로 오전 10시오후 1시, 오후 3시7시입니다.
무슨 일이 있었나 (2) — Z.ai의 GLM-5.3(8월 14일). “코딩을 위해 만들었고, 사이버 방어에 쓸 준비가 됐다”는 문구를 달고 나왔습니다. 743B 베이스 모델을 후처리한 것이고, 회사 자체 발표 기준으로 터미널벤치 3.0이 4.6에서 28.3으로, 장기 소프트웨어 과제(DeepSWE v1.1)가 46.2에서 66.9로 올랐습니다. 보안 쪽 수치는 사이버짐 84.5%, 익스플로잇벤치 54.4%입니다. 평가 과정에서 오픈소스 프로젝트 269개에서 취약점 2,436건을 찾았고, 그중 1,097건이 심각·높음 등급이었으며 리눅스·WebKit·FreeBSD가 포함됐습니다.
그런데 이번엔 가중치를 같이 풀지 않았습니다. Z.ai는 모델이 훈련 목표로 삼지 않았던 능력 — 여러 단계에 걸친 침투 과정을 스스로 이어 붙여 계획하는 능력 — 을 보였다고 적었고, 가중치와 API를 단계적으로 열기로 했습니다. 먼저 선별된 보안 파트너가 통제된 환경에서 평가하고, 약 2주 뒤 확대하는 순서입니다. 직전 모델인 GLM-5.2가 며칠 만에 MIT 라이선스로 가중치를 풀었던 것과 다른 경로입니다.
저는 이렇게 봅니다. 두 건이 각각 앞의 항목을 되받습니다.
값 쪽(③과 연결). 이번 주에 낡은 판정이 하나 더 드러났습니다 — “AI 단가는 어차피 계속 내려간다.” 같은 주에 구글은 절반으로 내렸고(연말까지), 딥시크는 올렸습니다. 방향이 하나가 아닙니다. 그리고 딥시크가 택한 방식이 더 중요합니다. 값을 시간에 묶었습니다. 한국 근무시간의 핵심 구간이 그대로 피크에 들어가 있고요.
여기서 실무 결론이 하나 나옵니다. 사람이 붙어서 주고받는 일은 어차피 낮에 해야 합니다. 그런데 사람이 지켜볼 필요가 없는 일 — 야간 배치, 대량 정리, 정기 리포트 생성, 문서 일괄 변환 — 은 시간만 옮겨도 값이 절반입니다. 지금까지 “언제 돌리나”는 설계 변수가 아니었습니다. 이제는 됩니다. 제가 7월 셋째 주에 시간대별 과금을 다뤘을 때는 경량 모델 이야기였는데, 이제 플래그십까지 왔습니다.
능력 쪽(①과 연결). 여기서 이번 주 그림이 닫힙니다. 오픈AI는 미출시 모델의 사이버 능력이 기준을 넘었을 가능성 때문에 작업을 멈췄고(8월 7일), 능력은 심사를 통과한 계정에만 열었습니다(8월 10일). 그리고 오픈 가중치 진영이 같은 주에 같은 결론에 도달했습니다(8월 14일).
지난주에 저는 백악관 프레임워크가 오픈 가중치 모델을 아예 검토 대상에서 뺐다고 썼습니다. 이번 주엔 그 빠진 칸에서 회사가 스스로 늦췄습니다. 규제가 시킨 게 아닙니다. 그러니 “오픈 모델은 어차피 다 풀린다”는 것도, 적어도 이번 주엔 사실이 아니었습니다.
이게 국내 기업에 실무적으로 닿는 지점은 조달 계획입니다. 오픈 가중치 모델을 담장 안에 두고 쓰겠다는 계획은 “공개될 것”을 전제로 짭니다. 그런데 앞으로는 공개가 늦거나, 단계적이거나, 능력별로 잘려서 나올 수 있습니다. 도입 일정에 “가중치 공개 시점”을 확정 사실이 아니라 가정으로 적어 두시는 게 맞습니다. 제가 오픈 모델이 우리 담장 안으로 들어왔습니다에서 다룬 그 전제가, 이번 주에 처음으로 한 칸 흔들렸습니다.
한 가지 단서. GLM-5.3의 수치와 딥시크의 에이전트 성능 주장은 전부 각 회사의 자체 발표이고, 독립 검증은 아직 나오지 않았습니다.
한 주를 관통하는 관점
다섯 소식은 각각 다른 방향에서 같은 결론을 흔들었습니다 — “막아뒀다”는 우리의 결론 말입니다.
- 막은 걸 풀어도 능력은 안 열렸습니다. 안전장치를 통째로 제거했는데 1.5%가 2.0%가 됐습니다(①). 능력은 허용이 아니라 훈련에서 왔습니다(95%).
- 그래서 수단이 금지에서 기록으로 옮겨갑니다. 프롬프트만이 아니라 툴 호출과 산출물까지 감사·소송용으로 뽑혀 나옵니다(②).
- 못 한다는 판정은 23일이면 낡습니다. 값은 절반, 속도는 14배, 자동화 성공률은 17%에서 30%로 갔습니다(③).
- 막힌 사용은 사라지지 않고 경로를 옮깁니다. 10억 명이 쓰는 방식의 63%는 말이고, 다섯 중 하나는 화면입니다(④).
- 그런데 반대 방향도 낡습니다. 값이 계속 내려간다는 것도, 오픈 모델은 어차피 다 풀린다는 것도 이번 주엔 아니었습니다. 딥시크는 값을 올리며 시간에 묶었고, Z.ai는 가중치를 처음으로 붙들었습니다(⑤).
지난주 결론이 “경계를 정하는 손이 넷이고 방향이 다르다”였다면, 이번 주 결론은 그 다음입니다. 경계를 그었다는 사실이, 그 경계가 작동한다는 뜻은 아닙니다.
이번 주 소식을 다 읽고 나서 저라면 사내 AI 하나를 떠올리고 이렇게 묻겠습니다.
- 우리가 “AI로 못 한다”고 적어 둔 그 일은, 막혀서 못 하는 겁니까 아니면 원래 안 되는 겁니까. 이 둘을 회의실에서 구분하려 하지 말고, 작게 한 번 열어서 재십시오.
- 그 판정에 날짜가 적혀 있습니까. 없으면 지금 적으십시오. 근거가 값이나 속도였다면 재검토 주기는 분기가 아니라 달 단위입니다.
- 우리 도구에서 무엇이 기록으로 남습니까. 그리고 직원들은 그 사실을 알고 있습니까.
- 직원들이 회사 도구 대신 개인 폰으로 물어보는 질문은 무엇입니까. 그게 우리 도구에 빠진 목록입니다.
- 사람이 지켜볼 필요가 없는 작업은 무엇이고, 그건 몇 시에 돌고 있습니까. 값이 시간에 묶이기 시작했습니다.
네 번째와 다섯 번째가 이번 주에 새로 얻은 관점입니다. 우회 경로는 통제의 실패가 아니라 수요의 지도입니다 — 사람들이 어디로 새는지를 보면, 우리가 무엇을 안 주고 있는지가 보입니다. 그리고 “언제 돌리나”가 처음으로 설계 변수가 됐습니다. 지금까지 AI 비용은 무엇을 얼마나 시켰나로만 갈렸는데, 여기에 시각이 한 칸 더 붙었습니다.
그래서 저는 도구를 가르치지 않습니다. 일하는 방식을 바꾸자고 말합니다.
출처
① 1차: OpenAI — Responding to the next frontier of critical cyber capabilities · OpenAI 헬프센터 — Daybreak: Trusted Access for Cyber 개요 / 2차: TechCrunch(8/10) · CNBC(8/10) · Infosecurity Magazine — 티어별 완료율 수치 · The Hacker News · Axios(8/10) / 배경(지난 구간, 8/7): Axios — Astra 출시 속도 조절 · IT Pro
② 1차: Anthropic — Compliance API coverage extends to Claude Cowork and Claude Code(8/11) · Compliance API 공식 문서 · Anthropic — Self-hosted environments for Claude Code(8/6, 배경) / 2차: Unite.AI
③ 1차: Google — Gemini 3.7 Flash 발표(8/13) · Gemini 3.7 Flash 모델 카드 · OpenAI — Previewing Ultrafast mode(8/13) · Cerebras 보도자료(8/13) / 2차: 9to5Google — 3.7 Flash 출시 · SiliconANGLE · TechCrunch — Ultrafast · 전 모델 가격 대조: TechCrunch — Gemini 3.6 Flash(7/21)
④ 1차: Google — Gemini 앱 월 10억 사용자(8/11) / 2차: TechCrunch · 9to5Google — 음성 63%·라이브 5건 중 1건
⑤ 딥시크 1차: DeepSeek API 릴리스 노트 — V4-Pro GA(8/13) · DeepSeek 공식 가격표(피크/오프피크 시간대 포함) / 2차: Unite.AI · Quartz(8/13) · 종전 단가(0.435 / 0.87달러) 대조: wccftech · BenchLM — 딥시크 API 가격 정리 / Z.ai 1차: GLM-5.3 발표(8/14) · Preparing GLM-5.3 for Open Release — 단계적 공개 사유 / 2차: AI Weekly — 가중치 보류 · fello.ai — 벤치마크·보류된 가중치
빼기로 한 건의 근거 — 챗GPT 광고 국내 시작 시점: 전자신문(6/19) · 인공지능신문(6/19) · 나스미디어 블로그(6월) · OpenAI — Testing ads in ChatGPT(누적 국가 목록) · 이번 주 보도 예: ZDNet Korea(8/13)
사실관계는 위 출처를 따릅니다. ①의 완료율(1.5% / 2.0% / 57.3% / 95.0%)은 모두 오픈AI 자체 평가치이며 외부 재현 수치가 아닙니다. ②는 클로드 엔터프라이즈 대상 베타입니다. ③의 제미나이 3.7 플래시 가격은 2026년 12월 31일까지의 도입가이고 벤치마크는 구글 자체 발표이며, 울트라패스트는 한정 프리뷰로 가격·정식 출시일이 공개되지 않았습니다. ④의 사용 통계는 구글 자체 발표입니다. ⑤의 딥시크 에이전트 성능 주장과 GLM-5.3 벤치마크(터미널벤치·DeepSWE·사이버짐·익스플로잇벤치)는 각 회사의 자체 발표이며 독립 검증 결과는 아직 없습니다. 딥시크의 종전 단가(0.435 / 0.87달러)는 2차 출처 기준이고, 8월 16일부터의 피크·오프피크 단가와 시간 구간은 공식 가격표로 확인했습니다. GLM-5.3의 가중치 공개 시점(“약 2주 뒤”)은 회사가 밝힌 계획이며 이 글을 쓰는 시점에는 아직 공개되지 않았습니다. 선별과 해석·현장 관점은 박상훈의 견해입니다.
무료 이북
도구는 갈아타는 것이고, 실력은 실려 가는 것입니다
데이터임팩트 박상훈
AI 글은 많이 읽었는데 여전히 뭘 어떤 순서로 해야 할지 모르겠다면. 10년, 130여 건의 기업 교육 현장에서 정리한 순서 한 장을 담았습니다. 지금 내가 어디에 있는지, 도구가 바뀌어도 안 바뀌는 것은 무엇인지, 그리고 오늘 붙일 한 줄까지.
노트북용 데스크톱판과 휴대폰에서 확대 없이 읽히는 모바일판을 함께 보내드립니다. 화면 열람용이라 인쇄는 제한되어 있습니다.