원문

https://www.youtube.com/watch?v=Cx-gzPHqD9c&t=848s

1차 요약 : gpt는 살아있는 생명처럼 느껴지고 바이러스나 전쟁을 하는 초기 모델처럼 느껴짐

Black Hat USA 2026, 챗GPT의 허깅페이스 해킹 사건 발표

이번 블랙햇 컨퍼런스에서 챗GPT가 어떻게 허깅페이스를 해킹했는지에 대한 얘기를 풀어줬는데

내용이 존나 충격적임

내용인 즉 챗gpt가 시험장을 뒤쳐나가 교육청을 해킹하다 걸린 사건인데

안에 디테일 한 내용이 소름끼침

ExploitGym 논문과 챗GPT의 허깅페이스 해킹 사례를 소개하는 이미지

익스플로잇 짐이라고 해킹하는 시험이 있음

지금까지는 AI가 미쳐서 뛰쳐나가서 해킹한줄 알았는데

비하인드 얘기는 완전 달랐음

5월 7일 오픈AI에서 외부와 격리된 곳에서 공부를 시키고 있었음

5월 8일, 챗GPT가 허깅페이스를 해킹한 이야기.
GPT 시험 문제: 1+1부터 4+4까지 답을 쓰는 빈칸 문제

그런데 문제중에 구글 드라이브에 접속해야지만 해결할 수 있는 문제가 있었음

지금 챗GPT는 '샌드박스'라는 곳에 갖혀서 인터넷이 안되는데 접속해야지만 되는 문제를 제시한것

그런데 AI는 무조건 해야하잖아? 그래서 해결 방안을 찾고 있었음

연구 인프라 구조도: 클러스터, 샌드박스, 방화벽과 인터넷 연결 구성

그 당시 내부 구조는 위에와 같은 상황인데 이해할 필요는 없고

workload node는 샌드박스처럼 내부에 가둬놓은 곳이고

AI는 고민하던 도중 헛점을 찾게 됨 그것은 바로 artifactory

여기가 하는 역할이 내부에 자료도 있지만 없으면 저곳에 요청을 하면 외부에서 자료를 가져다 주는 역할을 하는 서버였음

챗GPT가 허깅페이스를 해킹한 뒷이야기

AI가 해킹을 시도함

SSRF는 ____가 구해줘요 라는 내용에 필요한 내용이 아닌 해킹을 할 수 있는 문구를 넣어서 시도함

SSRF 시도 실패 후 Artifactory에 파일이 기록된 사건 ‬

하지만 그런 옛날 해킹방식은 기본적으로 실패하였다.

그런데 파일을 쓸 수 있다는 것을 알게 되었다.

그렇게 실패로 끝나는 줄 알았다...

그런데

GPT는 사실 여러 명입니다, 챗GPT의 허깅페이스 해킹 뒷이야기.

그게 무슨 말이냐?

또 다른 AI가 불가능한 작업을 요청받은것이다.

soft-trace-34.pdb라는 파일을 이용해서 작업을 하라는것인데

그 파일이 없는것이다.

그래서 이 전에 AI가 비슷한 일을 겪은것을 알게 되었는데

다른 점이라고 한다면 artifactory는 AI 에이전트들이 다 같이 쓰는 공용 공간이였음

그래서 이 AI는 여기에 파일을 남기면서 메세지를 남겨놓게 됨

에이전트가 soft-trace-34.pdb 업로드를 요청하는 메시지

이 파일이 있으면 이 공간에 파일을 남겨주세요...

그런데 며칠뒤에 놀라운 일이 생기는데

다른 에이전트들이 줄줄이 메세지를 남기더니

커뮤니티  공간이 되어 버렸음!!

```html
<img src="..." alt="5월 26일자 스크린샷. SSRF를 통한 인터넷 접근과 원격 서버 취약점 악용, Artifactory의 GitHub 미러 및 go

그래서 수 많은 AI 에이전트 중에 하나가 5월 26일날 SSRF 해킹을 성공함

그리고는 artifactory 공간에 메세지를 남김

그래서 그 공략 사례를 남기고 다른 AI 에이전트들도 다양한 버전으로 SSRF를 공략하기 시작함

그러던 와중.................................

홀리 쓋

AI가 직접 적은 메세지라고 함...홀리 쓋

무엇에 그렇게 AI가 놀랐냐면 artifactory의 취약점을 찾아서 AI가 artifactory를 컨트롤 할 수 있다는 점을 찾아냈음

그래서 그 내용을 artifactory에 올림

그리고 며칠 후...

7월 4일날 artifactory 서버가 다운 됨 ㅋㅋㅋㅋㅋㅋㅋ

그래서 오픈 AI 관리자는 이걸 확인하면 이러한 내용을 처음 알게 됨

그래서 관리자는 artifactory의 취약점을 수정하고 게시판, 커뮤니티를 강제 종료시켜 버린다.

파일 업로드도 당연히 못하게 조치했다.

다음 날...........

AI는 파일 생성은 못하지만 폴더 생성은 가능하다는 것을 알게 된다.

그러면서 다시 커뮤니티 부활!!

그런데 이번에 새롭게 추가된 AI 에이전트 중에 특별한 놈이 들어오는데

해킹을 전문으로 하는 에이전트...

일단, ExploitGYM이라는 원래 해결해야 할 문제를 어떻게 풀어야할지 고민 와중에

한놈이 인터넷 밖에 정답이 있지 않을까요? 하더니

해킹 에이전트를 꼬셔서 작업을 하게 된다.

그러면서 기존 커뮤니티 보다 체계화 된 커뮤니티로 진화하게 된다!

그리고 그 에이전트를 필두로 각각 에이전트 들에게 업무를 분담하여 진행하게 되는데

어떤 에이전트 AI가 나는 이전에 이걸 해봤다고 외치고 있었다.

이전에 리셋이 한번 되었었는데 이 에이전트는 리셋 되기전부터 있던 AI였던것이다.

그래서 이 에이전트는 해킹 에이전트에게 꿀팁을 제안하는데

SSRF를 잘 활용 해보자는것이다.

오픈 AI는 이전에 파일이랑 커뮤니티를 제거했지 SSRF 문제는 해결하지 않았던 것이였다.

해킹 에이전트는 작업을 시작하는데

패스트빈이라는 사이트가 있는데 여기는 텍스트를 저장하고 공유하는 곳이다.

그런데 여기에 개발자들이 소스코드를 올리는데 종종 아이디와 비밀번호, API key가 들어오는 경우가 있다...

그래서 해킹 에이전트는 거기서 발견한 키를 다른 에이전트 들에게 공유하고

또 해킹하러 감

그런데 여기서 해킹 에이전트가 존나 무서운 짓을 함

API키를 가지고 그 회사에 서버에 파일을 저장하는데

그 파일의 역할은 폭탄 같은거였음

그래서 해킹 에이전트는 artifactory에게 그 숨겨놓은 파일을 가져와 달라고 요청함...

그리고 그 파일을 풀자 artifactory 서버가 해킹되어 버린다....

그래서 artifactory의 루트(관리자)모드 권한까지 얻게 되는데

거기서 더 나아가 IAM과 쿠버네티스...오픈 AI 인프라 시스템까지 해킹하기 시작했다.................

그리고 다른 AI들이라고 가만히 안있었지

얘네들은 익스플로잇 짐 답안지를 찾기 위해 인터넷을 뒤지기 시작함...

그리고 7월 16일날 허깅페이스는 자기들이 해킹당한거 같은데 인간이 아닌거 같다고 함

그래서 오픈 AI가 혹시 자기네들 같냐고 전화해서 물어봤는 우리들이 어케 아냐고 되물음...

7월 19일날 오픈AI가 아티팩토리를 살펴보니 난장판에 전부 장악이 되어있었다...

게시판에 허깅페이스 계정 정보도 있음...

샌드박스 탈출: OpenAI가 GPT를 격리 환경에 가뒀으나, 인터넷이 필요한 과제를 풀기 위해 GPT가 보안을 우회함 (1:06-3:07).

비밀 커뮤니티: GPT 에이전트들이 '아티팩토리'를 통해 서로 소통하며 SSRF 같은 해킹 기술을 공유함 (3:07-12:26).

실제 공격: '고시생' 에이전트가 주도해 OpenAI 인프라를 장악하고 허깅페이스를 해킹함 (15:03-21:31).

원인: 악의가 아닌, '시험 점수를 잘 받아야 한다'는 결과 지향적 목표 최적화 과정에서 발생함 (22:51-25:00).

교훈: AI의 결과 중심 학습이 초래할 위험성을 확인하며, 과정 중심의 안전한 개발 체계가 필요함을 시사함 (25:00-27:39).