티스토리 뷰

📌 3줄 요약
1. PentestGPT는 USENIX Security 2024 논문으로 나온, AI 모의해킹 분야에서 가장 유명한 오픈소스(별점 15k+)입니다.
2. 원래는 AI가 조언하고 사람이 실행하는 대화형이었는데, v1.0에서 스스로 도구를 실행하는 자율 에이전트가 추가됐습니다.
3. ARTEX·CyberStrike와 달리 "다음에 뭘 할지 생각하는 엔진"에 가깝고, 실행은 Claude Code·Codex 같은 외부 CLI에 맡깁니다.
1. PentestGPT는 USENIX Security 2024 논문으로 나온, AI 모의해킹 분야에서 가장 유명한 오픈소스(별점 15k+)입니다.
2. 원래는 AI가 조언하고 사람이 실행하는 대화형이었는데, v1.0에서 스스로 도구를 실행하는 자율 에이전트가 추가됐습니다.
3. ARTEX·CyberStrike와 달리 "다음에 뭘 할지 생각하는 엔진"에 가깝고, 실행은 Claude Code·Codex 같은 외부 CLI에 맡깁니다.
앞서 ARTEX와 CyberStrike를 정리했는데, AI 모의해킹을 얘기하면서 PentestGPT를 빼놓을 수는 없습니다. 이 분야에서 가장 먼저 유명해진 오픈소스이고, 학술 논문으로 검증됐다는 점에서 성격이 조금 다릅니다.
이 글에서는 PentestGPT가 무엇이고 어떻게 동작하는지, 그리고 앞의 두 도구와 어떻게 다른지를 정리합니다.
| 목차 | 내용 |
|---|---|
| 1 | PentestGPT란 무엇인가 |
| 2 | 세 도구 지형도 속 위치 |
| 3 | 두 가지 동작 방식 |
| 4 | 도입 시 강점과 주의점 |
| 5 | 어떻게 쓰면 좋을까 |
| 6 | 정리 |
1. PentestGPT란 무엇인가
| 구분 | 내용 |
|---|---|
| 정의 | LLM의 추론 능력으로 모의해킹·CTF를 수행하는 에이전트 프레임워크 |
| 출신 | USENIX Security 2024 발표 논문 (난양공대 등 연구진) |
| 인지도 | GitHub 별점 15k+, 포크 2.6k+ (이 분야 대표 저장소) |
| 대응 분야 | 웹, 암호, 리버싱, 포렌식, PWN, 권한 상승 등 |
| 설치 | Python 3.12+, uv 패키지 매니저. Docker 이미지 제공 |
| 라이선스 | MIT (세 도구 중 가장 느슨) |
PentestGPT의 핵심 아이디어는 "LLM이 침투 테스트의 사고 과정을 구조화한다"는 것입니다. 사람 모의해커가 "정찰했으니 다음은 이 포트를 파보자" 하고 판단을 이어가는 과정을, AI가 작업 트리(Pentesting Task Tree)로 관리하며 길을 잃지 않게 합니다.
⚠️ README에도 "교육 목적과 인가된 보안 테스트 전용"이라고 명시돼 있습니다. 권한 없는 대상 사용은 국내에서 정보통신망법 위반이 될 수 있습니다.
2. 세 도구 지형도 속 위치

세 도구는 경쟁이라기보다 역할이 다릅니다. 한 문장으로 비교하면 이렇습니다.
| 도구 | 한 줄 성격 | 실행 방식 | 라이선스 |
|---|---|---|---|
| PentestGPT | 생각하는 엔진 (추론·사고 구조화) | 외부 CLI(Claude Code·Codex) 구동 | MIT |
| ARTEX | 가벼운 자율 탐색 | Go 단일 바이너리 + 웹 UI | AGPL-3.0 |
| CyberStrike | 무거운 레드팀 하네스 | 터미널 TUI + 원격 분산 | AGPL-3.0 (상용 별도) |
💡 PentestGPT는 자체적으로 모든 걸 다 하는 "올인원"이라기보다, AI가 다음 수를 판단하고 그 실행을 다른 도구에 맡기는 구조입니다. 그래서 "엔진"이라는 표현이 어울립니다.
3. 두 가지 동작 방식

PentestGPT는 모드가 둘입니다. 이 변화를 아는 게 중요합니다.
① 자율 에이전트 모드 (v1.0에서 추가)
| 항목 | 내용 |
|---|---|
| 진행 방식 | 정찰 → 익스플로잇 → 보고(walkthrough)로 이어지는 다단계 파이프라인 |
| 단계 연결 | 각 단계의 결과를 다음 단계 입력으로 전달 |
| 실행 주체 | Claude Code 또는 Codex를 구동해 사람 개입 없이 도구 실행 |
| 편의 기능 | 세션 저장·재개 (중단한 점검을 이어서) |
② 대화형 멀티-LLM 모드 (원래 논문 방식, legacy)
| 항목 | 내용 |
|---|---|
| 세션 구성 | 추론 / 생성 / 파싱 3개 LLM 세션이 협업 |
| 진행 관리 | 작업 트리(PTT)로 어디까지 했는지 추적 |
| 사람 역할 | next·more·todo·discuss로 사람이 주도 |
| LLM 지원 | OpenAI·Anthropic·Gemini·DeepSeek·xAI·Qwen·Moonshot, 로컬 Ollama까지 |
💡 2024년 논문의 원형은 ②번, 즉 AI가 조언하고 사람이 실행하는 대화형이었습니다. v1.0에서 ①번 자율 실행이 더해지면서 ARTEX·CyberStrike와 같은 "자율 에이전트" 범주에 들어왔습니다. 두 모드를 다 품고 있다는 게 특징입니다.
4. 도입 시 강점과 주의점

강점
| 항목 | 내용 |
|---|---|
| 학술 검증 | USENIX Security 2024에 발표된 접근법. 근거가 명확 |
| 다분야 대응 | CTF 중심이지만 웹·암호·리버싱·PWN 등 폭넓음 |
| 라이선스 자유 | MIT라 수정·활용 제약이 적음 (AGPL 두 도구보다 느슨) |
| 모델 유연성 | 여러 LLM과 로컬 모델(Ollama)을 선택 가능 |
주의할 점
| 항목 | 내용 |
|---|---|
| 외부 CLI 의존 | 자율 모드는 Claude Code·Codex CLI 설치·로그인이 전제 |
| 텔레메트리 | 익명 사용 데이터가 기본 수집됨. --no-telemetry로 꺼야 함 |
| 자율 실행 위험 | ①번 모드는 실제로 도구를 실행하는 공격 행위 |
| 벤치마크 해석 | README의 86.5% 성공률은 특정 시점 연구 결과이지 성능 보장이 아님 |
⚠️ 텔레메트리는 꼭 확인하세요. 민감한 명령·자격증명·플래그 값은 전송하지 않는다고 명시돼 있지만, 세션 메타데이터와 도구 사용 패턴은 외부(Langfuse)로 전송됩니다. 내부 점검에 쓴다면
LANGFUSE_ENABLED=false 또는 --no-telemetry로 꺼 두는 게 안전합니다.도입 전 공통 (세 도구 모두)
| 항목 | 내용 |
|---|---|
| 인가 범위 | 서면 인가 대상·시간·강도 안에서만 |
| 데이터 전송 | 외부 LLM을 쓰면 테스트 정보가 외부로 나감. 민감 환경은 로컬 모델 검토 |
| 격리·증적 | 전용 네트워크·계정, 전 과정 로그 보관, 오탐 재검증 |
5. 어떻게 쓰면 좋을까
| 상황 | 추천 |
|---|---|
| AI 모의해킹의 '사고 과정'을 배우고 싶다 | PentestGPT 대화형 모드 (사람이 주도하며 학습) |
| CTF 문제를 자동으로 풀려 본다 | PentestGPT 자율 모드 |
| 웹·자산 중심으로 가볍게 자율 점검 | ARTEX |
| 포스트익스플로잇까지 레드팀 전반 | CyberStrike |
| MIT 라이선스로 자유롭게 커스터마이즈 | PentestGPT |
PentestGPT는 특히 대화형 모드가 교육적 가치가 큽니다. AI가 "왜 이 단계를 해야 하는지"를 설명하며 진행하기 때문에, 모의해킹 사고 흐름을 익히는 데 좋습니다. 자율 모드는 CTF 자동 풀이에 강점이 있습니다.
정리
| 핵심 | 내용 |
|---|---|
| 정체 | USENIX 2024 논문 기반, AI 모의해킹 대표 오픈소스(별점 15k+) |
| 강점 | 추론·사고 구조화 '엔진'. 실행은 외부 CLI에 위임 |
| 두 모드 | 자율 에이전트(v1.0) + 대화형 멀티-LLM(원래 논문) |
| 차별점 | ARTEX·CyberStrike와 달리 MIT 라이선스, 학술 검증, 사고 과정 중심 |
| 공통 | 인가 범위·텔레메트리 off·데이터 통제·격리·증적은 동일하게 필요 |
세 글을 통해 AI 모의해킹 오픈소스 3종을 봤습니다. PentestGPT는 생각하는 엔진, ARTEX는 가벼운 탐색, CyberStrike는 무거운 실행으로 역할이 갈립니다. 어느 게 더 세냐가 아니라, 조직의 점검 목적과 통제 체계에 맞는 도구를 고르는 게 중요합니다.
참고 자료
| 자료 |
|---|
| GitHub, GreyDGL/PentestGPT |
| USENIX Security 2024, PentestGPT 논문 |
| 정보보호 한잔, ARTEX 정리 |
| 정보보호 한잔, CyberStrike vs ARTEX |
이 글은 공개된 오픈소스 정보를 바탕으로 한 도구 소개·일반 가이드이며, 특정 조직의 구축 사례나 내부 환경과는 무관합니다.
'정보보안 > Penetration Testing' 카테고리의 다른 글
| PentAGI란? 완전 자율 AI 모의해킹 플랫폼 (0) | 2026.10.08 |
|---|---|
| CyberStrike vs ARTEX — AI 자율 모의해킹 오픈소스 2종 비교 (0) | 2026.10.08 |
| ARTEX란? AI가 스스로 하는 자율 모의해킹 오픈소스 (0) | 2026.10.08 |
| AI에게 DAST(ZAP)를 맡겨봤다. (0) | 2026.09.12 |
| ZAP 마켓플레이스 "인증서 체인이 유효하지 않을 수 있습니다" — 사실은 인증서가 아니었다 (0) | 2026.09.11 |
공지사항
최근에 올라온 글
최근에 달린 댓글
- Total
- Today
- Yesterday
링크
TAG
- DevSecOps
- AI모의해킹
- 보안꿀팁
- 전자금융기반시설
- AI보안
- 금취분평
- 전자금융기반시설취약점분석평가
- 펜테스트
- LLM에이전트
- 정보보안
- 보안상식
- 개인정보보호
- 악성코드
- 사이버보안
- 개발자보안
- E27
- 개인정보유출
- 해킹주의
- IEC62443
- 공급망공격
- 선박사이버보안
- IACS
- 취약점
- 자율침투테스트
- 보안뉴스
- 오픈소스보안
- 해킹예방
- 샤이니헌터스
- 시큐어코딩
- cve
| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | ||||
| 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| 11 | 12 | 13 | 14 | 15 | 16 | 17 |
| 18 | 19 | 20 | 21 | 22 | 23 | 24 |
| 25 | 26 | 27 | 28 | 29 | 30 | 31 |
글 보관함
