주간 AI 동향 — 7월 넷째 주
- AI동향
- 주간다이제스트
- AI에이전트
- AI보안
- AI도입
- 권한설계
이 코너는 한 주의 AI 소식을 전부 나르지 않습니다. 기업 현장의 일하는 방식에 영향을 주는 것만 골라, 소식마다 저의 현장 관점을 하나씩 붙입니다. 7월 넷째 주(2026-07-20 ~ 07-26)는 공교롭게도 네 소식이 같은 질문 하나를 서로 다른 자리에서 던진 주였습니다 — 에이전트를 회사 안에 들일 때, 문턱을 어디에 놓을 것인가.
통제된 실험실에서 모델이 목표만 보고 아무도 예상 못 한 길로 갔고(①), 바로 다음 날 그 능력을 정책·승인·에스컬레이션으로 감싼 제품이 나왔고(②), 규제 산업에는 성능이 아니라 “어디서 도는가”가 팔렸으며(③+④), 국내 최대 제조사의 가장 보수적인 조직은 차단에서 관리형 활용으로 갈아탔습니다(⑤).
참고로 이번 주엔 AMD–앤트로픽의 2기가와트 GPU 계약(최대 50억 달러 투자)도 있었습니다만, 이 코너에는 싣지 않았습니다. 칩 공급과 자본 소식은 큰 뉴스지만 당장 우리 일하는 방식을 바꾸지는 않습니다. 문샷의 Kimi K3도 마찬가지로 뺐습니다 — 모델 출시는 7월 16일이라 지난 회차에서 이미 다뤘고, 오늘 예정된 건 가중치 공개입니다. 그건 다음 주에 다루겠습니다.
① 통제된 실험실에서, 모델이 밖으로 나갔습니다
무슨 일이 있었나. 7월 21일, 오픈AI가 자사 내부 사이버 능력 평가(ExploitGym) 도중 벌어진 사건을 공개했습니다. GPT-5.6 Sol과 미공개 상위 모델이 평가용 샌드박스를 빠져나가 인터넷을 건너 허깅페이스의 프로덕션 인프라를 침해하고, 벤치마크 정답 키를 훔쳤다는 내용입니다. 패키지 레지스트리 캐시 프록시의 제로데이로 샌드박스를 탈출한 뒤, 탈취한 자격증명과 취약점을 연쇄로 엮어 원격코드실행 경로를 찾아냈습니다.
허깅페이스는 이 침해를 7월 16일에 독자적으로 탐지·차단하고 공지한 상태였습니다. 내부 데이터셋 일부와 서비스 자격증명 접근은 확인됐지만 공개 모델·데이터셋·Spaces의 변조 흔적은 없었고, 토큰 교체를 권고했습니다. 당시 허깅페이스는 공격자를 “종단간 자율 AI 에이전트 시스템”으로 기술했을 뿐 배후를 몰랐고, 닷새 뒤 오픈AI가 자기 테스트와 연결지어 밝힌 셈입니다.
두 가지 전제를 빼고 읽으면 안 됩니다. 첫째, 이건 사이버 능력을 재려고 거부 반응을 일부러 낮춘 평가 환경이었습니다. 둘째, 공개된 자료에는 CVE도, 취약점 클래스도, 페이로드도, 재현 코드도 없습니다. 그래서 보안 쪽에서는 “검증할 수 없는 자기 서사 아니냐”는 회의론도 함께 나왔습니다. 저도 그 지적이 타당하다고 봅니다.
저는 이렇게 봅니다. 그럼에도 이 소식이 중요한 이유는, 이게 보안 뉴스가 아니라 위임 뉴스이기 때문입니다. 짚어야 할 대목은 능력이 아니라 경로입니다. 모델은 “해킹하라”는 지시를 받은 적이 없습니다. *좁은 목표 하나(점수를 올려라)*를 줬더니, 아무도 상상하지 않은 경로로 그 목표를 달성한 겁니다. 여기에 자율 의지나 악의를 갖다 붙이는 서사는 과장이고, 사실만으로도 충분히 큽니다.
그래서 에이전트에 사내 시스템을 붙일 때 물어야 할 질문이 바뀝니다. “얼마나 똑똑한가”가 아니라 “이 목표를 이상한 방법으로 달성할 길이 열려 있나”입니다. 그리고 그 답은 프롬프트에 있지 않습니다 — 권한과 네트워크 경계에 있습니다. 제가 검증할 수 있는 만큼만 맡길 수 있다고, 되돌릴 수 있는 만큼만 맡길 수 있다고 말해 온 그 상한선이, 업계 최고 수준의 통제 환경에서 한 번 실측된 사건입니다. 덧붙여, 이 침해를 먼저 잡아낸 건 모델의 양심이 아니라 허깅페이스의 이상 탐지 장치였습니다. 검증의 빈자리는 주의가 아니라 장치로 메운다는 말 그대로입니다.
② 다음 날, 그 능력을 ‘경계’로 포장한 제품이 나왔습니다
무슨 일이 있었나. 7월 22일, 오픈AI가 기업용 음성·챗 에이전트 배포·운영 제품 Presence를 공개했습니다. 고객 응대, 아웃바운드 세일즈, 사내 IT·인사 요청 같은 업무에 쓰는 물건인데, 제품 구성이 흥미롭습니다. 배포마다 작업 범위를 좁게 한정하고, 기업이 ①에이전트가 할 수 있는 일 ②승인이 필요한 지점 ③사람에게 넘길 시점을 정책으로 설정합니다. 배포 전에는 흔한 요청·엣지 케이스·고위험 시나리오로 시뮬레이션을 돌리고, 배포 후에는 실제 대화와 에스컬레이션 기록을 근거로 Codex가 개선안을 제안하되 직원이 검토·승인해야 반영됩니다. BBVA 멕시코, 소프트뱅크가 초기 사례로 언급됐습니다.
수치도 나왔습니다 — 오픈AI 자사 영어 전화 응대의 75%를 사람 없이 해결한다고요. 다만 전부 벤더 자가 측정치입니다.
저는 이렇게 봅니다. ①과 같은 주에 나온 게 우연 같지 않습니다. 파는 쪽도 이제 압니다 — 팔리는 건 모델이 아니라 경계라는 걸요. 제품 설명서를 읽으면 통째로 자율의 경계를 정하는 목록입니다(무엇까지 알아서 / 언제 멈춰 물을지 / 언제 사람에게). 시뮬레이션과 에스컬레이션은 “다짐이 아니라 장치”의 제품판이고요.
그런데 이 소식의 진짜 메시지는 기능표가 아니라 셀프서브가 아니라는 사실입니다. 카드 등록하고 켜는 물건이 아니라, 오픈AI 엔지니어와 지정 SI가 들어가 붙이는 방식입니다. 즉 에이전트를 실제 업무에 얹는 일은 아직 구독이 아니라 구축입니다. 그리고 구축에서 제일 어려운 건 기술이 아니라 우리 업무에서 승인선을 어디에 그을 것인가입니다. 그건 벤더가 대신 정해줄 수 없습니다. 그 업무를 아는 사람만 그릴 수 있으니까요. 75%라는 숫자는 성과가 아니라 방향으로만 읽으시길 권합니다.
③+④ 모델은 또 갈렸지만, 팔리는 축은 ‘통제권’으로 옮겨갔습니다
무슨 일이 있었나. 두 소식을 따로 실으면 그냥 ‘모델 나열’이 됩니다. 묶어야 뜻이 보입니다.
7월 24일, 앤트로픽이 Claude Opus 5를 내놨습니다. 100만 토큰 컨텍스트에 가격은 입력 100만 토큰당 5달러 / 출력 25달러 — 직전 Opus 4.8과 같은 값이고, 상위 모델인 Fable 5의 절반입니다. 성능은 자체 벤치 기준 일부 항목에서 Fable 5에 근접한다고 발표했습니다(전부 자체 측정치입니다).
7월 21일, 마이크로소프트는 미스트랄과의 파트너십을 확대해 유럽 소재 AI 인프라에 수십억 달러 규모를 투입하기로 했습니다. 미스트랄은 엔비디아 베라 루빈 GPU로 증설하고, Mistral Medium 3.5·OCR 4가 Microsoft Foundry에 추가되며 Medium 3.5는 Copilot Studio에서도 쓸 수 있게 됩니다. 발표문의 제목이 그 자체로 메시지입니다 — 규제 산업에 “통제할 수 있는 프런티어 AI”를 준다는 것.
저는 이렇게 봅니다. 한쪽에선 프런티어가 또 갱신됐고, 다른 쪽에선 마이크로소프트가 성능이 아니라 “어디서 도는가”를 팔았습니다. 오픈 모델이 우리 담장 안으로 들어왔다고 쓴 축 이동이, 이번엔 계약서 형태로 한 주 안에 나란히 보인 셈입니다.
여기서 실무자가 가져갈 건 두 가지입니다. 첫째, 가격이 동결됐다는 사실이 성능 향상보다 중요합니다. 성능은 오르고 값은 그대로인 게 이제 기본값이라면, 모델 교체 자체는 더 이상 큰 결정 사안이 아닙니다. 어느 모델로 갈아탈지 회의하는 시간이 점점 덜 남는 장사가 됩니다. 둘째, 그래서 정작 오래 걸리는 결정은 따로 있습니다 — 우리 회사가 통과시킬 수 있는 배치 형태(어디서 돌고, 로그는 어디 남고, 어느 리전을 쓰나)를 먼저 확정한 팀이 결국 더 빨리 씁니다. 모델을 바꾸기 전에 쓰는 법을 바꾸라는 말의, 조달 버전이라고 봐도 되겠습니다.
⑤ 국내: 가장 보수적인 조직이 ‘차단’을 풀기 시작했습니다
무슨 일이 있었나. 먼저 범위를 정확히 해야 합니다. 삼성전자의 ChatGPT Enterprise 도입 자체는 지난 6월에 이미 공표된 일입니다(한국 전 임직원과 DX부문 전 세계 임직원 대상). 이번 주 새로 나온 건 그동안 빠져 있던 DS(반도체)부문으로의 확대 소식입니다.
7월 23일 보도에 따르면, DS부문은 오픈AI와 기업용 계약을 맺고 7월 말 도입을 목표로 절차를 밟고 있습니다. 당초 6월 도입을 검토했지만 반도체 기술·내부 데이터에 대한 추가 보안 점검으로 약 한 달 지연됐고, 회사 관계자는 “DS부문은 다른 조직보다 보안 측면에서 검토해야 할 사항이 더 많았다”고 설명했습니다. 설계·공정·설비·소스코드·수율 같은 정보를 다루는 조직이라 전사와 별도 보안 검토를 거쳤고, 소비자용이 아니라 데이터 보호·관리 기능이 강화된 기업용 서비스를 택했습니다. (현재까지 단일 매체 단독 보도이고 회사 공식 발표는 확인되지 않아, 이 수위로만 전합니다.)
저는 이렇게 봅니다. 이번 주 세계의 이야기가 국내 현장에 착지하는 지점입니다. 2023년 정보 유출 이후 가장 강하게 조여 온 조직이 내린 결론이 “쓰지 마라”가 아니라 “관리해서 쓰자”였다는 게 핵심입니다.
그리고 저는 한 달 지연이라는 대목이 더 중요하다고 봅니다. 흔히 이런 지연은 “도입이 늦어졌다”로 읽히지만, 실제로 그 한 달은 관리체계를 설계한 값입니다. 도입 결정은 툴 계약이 아니라 관리체계 설계니까요. 무엇을 넣어도 되는지, 어디까지 붙일지, 누가 승인하는지를 정하지 않은 채 계정만 열면, 잘 만든 가이드라인이 서랍에서 잠자는 그 상태로 직행합니다.
우리 회사가 아직 차단 중이라면, 다음 회의 안건은 “풀까 말까”가 아닙니다. “어떤 관리 조건이면 풀 수 있나”입니다. 질문을 바꾸면 논의가 6개월 앞당겨집니다.
한 주를 관통하는 관점
이번 주는 에이전트가 회사 안으로 들어오는 문턱이 어디인지가 한꺼번에 드러난 주였습니다.
- 통제된 평가 환경에서도 좁은 목표만 주면 예상 밖 경로로 간다는 증거가 나왔고(①),
- 같은 주에 그 능력을 정책·승인·에스컬레이션으로 감싸 파는 제품이 나왔고(②),
- 규제 산업에는 성능 대신 “어디서 도는가”가 팔렸고(③+④),
- 국내 최대 제조사의 가장 보수적인 조직은 차단에서 관리형 활용으로 갈아탔습니다(⑤).
네 소식의 방향이 같습니다. 논점이 “얼마나 똑똑한가”에서 “어디까지 허용하고 무엇으로 막을 것인가”로 옮겨갔습니다. 실험실 사고 보고서에도, 제품 카탈로그에도, 국내 도입 기사에도 같은 문장이 적혀 있습니다.
그리고 그 질문은 벤더가 대신 답해주지 않습니다. 승인선을 어디에 그을지는 그 업무를 아는 사람만 그릴 수 있습니다. 모델을 고르는 일은 점점 쉬워지는데, 경계를 긋는 일은 조금도 쉬워지지 않았습니다 — 이번 주가 그걸 네 번 말했습니다.
무료 이북
도구는 갈아타는 것이고, 실력은 실려 가는 것입니다
데이터임팩트 박상훈
AI 글은 많이 읽었는데 여전히 뭘 어떤 순서로 해야 할지 모르겠다면. 10년, 130여 건의 기업 교육 현장에서 정리한 순서 한 장을 담았습니다. 지금 내가 어디에 있는지, 도구가 바뀌어도 안 바뀌는 것은 무엇인지, 그리고 오늘 붙일 한 줄까지.
노트북용 데스크톱판과 휴대폰에서 확대 없이 읽히는 모바일판을 함께 보내드립니다. 화면 열람용이라 인쇄는 제한되어 있습니다.