골든래빗은 더 탁월한 가치를 제공하는 콘텐츠 프로덕션 & 프로바이더 입니다. 골든래빗은 취미, 경제, 수험서, 만화, IT 등 다양한 분야에서 책을 제작하고 있습니다.골든래빗은 더 탁월한 가치를 제공하는 콘텐츠 프로덕션 & 프로바이더 입니다. 골든래빗은 취미, 경제, 수험서, 만화, IT 등 다양한 분야에서 책을 제작하고 있습니다.

[아티클 03] AI 에이전트, 하네스가 필요할 때

2026년 9월 23일조회 15

이 글은 《요즘 AI 루프 엔지니어링, 클로드 코드, 스킬, MCP, 훅, 컨텍스트, 하네스, 리뷰, 오케스트레이션, LLMOps, Langfuse》에서 발췌했습니다.

요즘 AI 루프 엔지니어링, 클로드 코드, 스킬, MCP, 훅, 컨텍스트, 하네스, 리뷰, 오케스트레이션, LLMOps, Langfuse

요즘 AI 루프 엔지니어링, 클로드 코드, 스킬, MCP, 훅, 컨텍스트, 하네스, 리뷰, 오케스트레이션, LLMOps, Langfuse

ISBN 9791124516492지은이 박승규34,000
교보문고예스24알라딘

[아티클 03]  AI 에이전트, 하네스가 필요할 때

모델이 아무리 똑똑해져도 풀리지 않는 문제가 있습니다. 우리는 이미 컨텍스트 엔지니어링을 배웠고, 스킬도 만들었는데 이 정도도 부족한 걸까요? 사실, 1년 전 같았으면 필요 없었을지도 모릅니다. 하지만 지금은 조금 다르죠. 에이전트에게 한 시간짜리 작업을 맡겨놓고 점심을 먹으러 나가는 시대에 들어왔습니다. 개발자가 퇴근한 뒤에도 AI가 밤새 대신 개발하는 시대라는 말입니다. 그러나 사용자가 자리를 비우는 시간 동안 AI에게 일을 잘 시키려면 ‘딸깍’이 아닌 꽤 많은 노력이 필요합니다. 나중에는 이마저도 추상화와 최적화가 되겠죠. 하지만 아직까지는 노력이 필요합니다. 저와 제 주변 개발자들은 방망이 깎던 노인의 이야기에 빗대어 ‘하네스를 깎는다’라고 얘기합니다. 그럼 왜 하네스가 필요한지 구체적인 사례로 알아봅시다.

실패 사례 1 : 자율 시간이 길어질수록 어긋나는 결과물

여러분이 오후 2시쯤 에이전트에게 ‘weather API에 forecast 엔드포인트 하나 추가해줘’라고 시켜놓고 잠깐 회의에 다녀왔다고 해봅시다. 돌아와서 터미널을 보니 에이전트가 아직 일하고 있습니다. 한 시간 반쯤 지난 것 같습니다. 대화 로그를 쭉 훑어보면 이런 그림이 그려집니다.

이것은 컨텍스트 오염의 전형입니다. 지나간 정보가 사라지지 않고 남아 다음 추론 결과까지 오염시킵니다. 컨텍스트 오염은 대화 히스토리, 파일, 지시, 도구 출력 네 가지 경로로 발생한다고 이야기했습니다. 한 세션이 길어지면, 컨텍스트 오염은 피하기 어렵습니다. 초반에 났다가 해결된 에러가 중반에 다시 살아나고 이미 지나간 변경을 다시 끄집어내죠. 사용자 입장에서는 에이전트가 끝난 작업에 미련을 가지는 것처럼 보이는 경우가 왕왕 있습니다.

/compact 같은 압축 명령으로 줄여도 한계가 있습니다. 세션을 아예 새로 여는 방법이 가장 확실합니다. 그러려면 사람이 중간에 개입해 지금까지 한 일을 다음 세션에 넘겨줘야 합니다. 결국 에이전트 하나를 한 세션에서 오래 돌려서 일하게 하면 컨텍스트 오염을 피하기가 어렵습니다. 세션을 의도적으로 잘게 쪼개고, 쪼개진 세션 사이의 인수인계를 누군가가 책임지는 구조가 필요합니다.

실패 사례 2 : 확증 편향

두 번째는 역할에 관한 이야기입니다. 에이전트에게 코드를 작성하게 하고, 같은 에이전트에게 코드 리뷰를 지시해본 적이 있을 것입니다. 저는 정말 여러 번 시도했는데, 결과가 깔끔했던 적이 거의 없습니다. 사람도 자기가 만든 결과물을 좋게 평가하는 경향이 있습니다. 에이전트도 마찬가지입니다. 자신이 작성한 코드에 대해 굉장히 너그러운 태도를 가집니다. 에이전트는 그 코드가 맞다고 믿는 상태로 리뷰에 들어갑니다. 자기가 내린 결정의 전제가 컨텍스트 안에 이미 주입되어 있기 때문입니다. 왜 이렇게 코드를 작성했는지 새로이 묻지 않습니다. 사람이 작성한 코드도 다른 사람이 검토할 때 더 나은 리뷰 결과가 나오는 경우가 많습니다. 리뷰는 다양한 각도에서 하는 것이 훨씬 더 도움이 됩니다. 에이전트 시스템에서도 같은 원리가 통합니다. 작성자와 검토자는 다른 에이전트여야 합니다. 즉, 한 에이전트의 작업물을 다른 에이전트가 검토할 수 있는 구조가 필요합니다.

실패 사례 3 : 사람의 개입 자체가 병목이다

여러분이 에이전트에게 일을 시켜놓고 밥을 먹고 왔다고 해봅시다. 밥 먹고 왔더니 npm install을 위해 사용자의 승인을 기다리고 있습니다. 이렇게 허망한 상황을 방지하기 위해 권한을 미리 부여하죠. npm install 같은 설치 명령은 그나마 파괴적인 영향이 적으니 권한을 줄 수 있습니다. 하지만 rm -rf node_modules 같은 명령은 쉽사리 권한을 주기 힘듭니다. 보고 승인해야겠죠. 1시간 동안 에이전트에게 일을 시키려고 했던 계획은 사람이 권한을 주지 않아서 시작도 못하는 상황이 되었습니다.

만약에 퇴근 후나 밤에 에이전트에게 일을 시키고자 하는 경우라면 컴퓨터를 켜 놓은 채 대기시켜 놓았기 때문에 전기만 낭비한 셈이 될 것입니다. 이런 사람의 개입을 어떻게 줄일 수 있을까요? 의사결정을 위한 다른 에이전트나 규칙 등 의사결정 자동화 구조가 필요할 것입니다.

실패 사례 4 : 평균 수렴

에이전트에게 우리 서비스의 환불 처리를 고쳐 달라고 하면, 일반적인 교과서 코드를 내놓을 때가 많습니다. 우리 팀이 정해둔 환불 정책이나 이 도메인에만 있는 예외는 빠져 있습니다. 대충 보면 맞는 것처럼 보이지만 정작 우리에게 필요한 답은 아닙니다. 모델은 방대한 일반 데이터로 학습되었습니다. 따로 정보를 주지 않으면 가장 흔한 패턴을 따라갑니다. 학습 데이터의 평균에 가까운 답을 내놓는 겁니다. 우리가 원하는 것은 도메인의 구체적인 지식인데, 모델은 평범한 모범 답안으로 회귀하는 셈입니다. AI 모델이 우리가 일하는 도메인에 대한 지식이 부족한 경우, 더욱 부정확하거나 엉뚱한 답변을 내놓을 수 있습니다.

프롬프트에 매번 배경을 길게 적어줄 수도 있지만, 작업마다 같은 설명을 반복해야 하고 그마저도 빠뜨리기 쉽습니다. 모델이 우리 도메인의 지식을 활용하게 하려면, 그 지식이 에이전트가 읽을 수 있는 형태로 환경 안에 놓여 있어야 합니다. 규칙, 결정 사례, 예외를 저장소에 정리해두고 에이전트가 필요할 때 참고할 수 있는 구조가 필요합니다.

지금까지 네 가지 사례를 살펴봤습니다. 공통점은 프롬프트를 잘 만들거나 스킬을 잘 만드는 것으로 해결이 안 된다는 점입니다. 모델이 똑똑해지면 해결이 될까요? 됐다가 안 됐다가 할 것입니다. 무엇으로 이 빈자리를 메워야 할까요? 네 가지 사례의 해결 방안에는 구조라는 말이 계속 등장했습니다. 바로 하네스입니다.

사람의 개입 없이 반복 실행할 수 있는 메커니즘

여러 에이전트가 협업할 수 있는 환경

파괴적인 명령은 막고 안전한 명령만 통과시키는 가드레일

에이전트가 참고할 수 있는 도메인 지식

📚 더 읽기

저자 소개

박승규

박승규

아직도 개발이 재미있는 19년 차 개발자입니다. 웹 개발, 게임 백엔드, 플랫폼과 인프라까지 다양한 영역을 거쳤고, 지금은 카카오엔터테인먼트에서 AI 모델을 활용한 애플리케이션을 개발하고 있습니다. 이 책에는 그 과정에서 에이전트를 직접 다루며 정리한 내용을 담았습니다.

- 현) 카카오엔터테인먼트 AI응용기술개발팀

- 전) 트리노드 서버 개발 (포코팡, 포코포코)

- 전) NHN Japan 플랫폼 개발팀


저서

- 《Node.js 백엔드 개발자 되기》

- 《요즘 AI 에이전트 개발, LLM RAG ADK MCP LangChain A2A LangGraph》


블로그·SNS

- blog.gyus.me

- twitter.com/wapj2000

- brunch.co.kr/@wapj2000

📚요즘 AI 루프 엔지니어링, 클로드 코드, 스킬, MCP, 훅, 컨텍스트, 하네스, 리뷰, 오케스트레이션, LLMOps, Langfuse》 자주 묻는 질문

Q.AI 성능은 좋아지는데 개발 업무 시간은 그대로인 것 같아요. 어떻게 하면 AI를 활용해서 실제 업무 시간을 줄일 수 있을까요?

많은 개발자분들이 AI 모델의 발전에도 불구하고 실제 업무 시간이 크게 줄어들지 않아 고민이 많으실 겁니다. 기존에는 단순히 더 좋은 모델을 사용하거나 프롬프트를 정교하게 작성하는 데 집중했지만, 이 책에서는 그보다 더 근본적인 해결책을 제시합니다. 바로 'AI가 스스로 일하는 루프 시스템'을 설계하는 것입니다. AI가 작업을 계획하고, 실행하고, 검증하며, 실패 시 복구하고, 다음 작업으로 자연스럽게 이어가는 자동화된 시스템을 구축함으로써 AI가 사람의 개입 없이도 지속적으로 업무를 처리하게 만드는 것이 핵심입니다. 단순히 질문에 답하는 AI를 넘어, 전체 워크플로를 주도적으로 처리하는 AI 에이전트를 만드는 것이죠. 이 책은 클로드 코드의 스킬, MCP, 훅, 컨텍스트, 하네스, 리뷰, 오케스트레이션, LLMOps, Langfuse 등 최신 기술들을 활용하여 이러한 루프 시스템을 실제 개발 환경에 구현하는 방법을 실전적으로 다룹니다. 깃허브 이슈 생성부터 코드 리뷰 반영까지, AI가 스스로 처리하는 과정을 직접 경험하며 업무 효율을 극대화하는 방법을 배우실 수 있습니다. 더 이상 프롬프트만으로 한계를 느끼셨다면, 《요즘 AI 루프 엔지니어링, 클로드 코드, 스킬, MCP, 훅, 컨텍스트, 하네스, 리뷰, 오케스트레이션, LLMOps, Langfuse》를 통해 AI가 끝까지 일하는 시스템을 만드는 방법을 익혀보세요.

Q.AI 에이전트 개발을 시작하고 싶은데, 어떤 기술들을 익혀야 할지 막막합니다. 특히 '루프 엔지니어링'이라는 개념이 궁금해요.

AI 에이전트 개발에 관심을 가져주셔서 감사합니다. '루프 엔지니어링'은 단순히 AI 모델에게 지시를 내리는 프롬프트 엔지니어링을 넘어, AI가 주어진 작업을 스스로 계획하고 실행하며, 결과물을 평가하고 개선해 나가는 순환적인 시스템을 설계하는 것을 의미합니다. 마치 사람이 업무를 처리하는 방식처럼 AI가 지속적으로 학습하고 발전하며 목표를 달성하도록 만드는 것이죠. 이 책에서는 이러한 루프 시스템을 구축하기 위해 필수적인 다양한 기술들을 소개합니다. 예를 들어, 클로드 코드의 '스킬'을 활용하여 에이전트에게 특정 기능을 부여하고, 'MCP(Multi-agent Communication Protocol)'를 통해 여러 에이전트가 협력하도록 만듭니다. 또한 '훅(Hook)'을 이용해 특정 이벤트 발생 시 자동으로 코드를 실행하거나 위험한 명령을 차단하고, '컨텍스트(Context)'를 통해 에이전트가 작업에 필요한 정보를 유지하도록 돕습니다. '하네스(Harness)'는 에이전트의 실행 환경을 제어하고, '리뷰(Review)'를 통해 생성된 결과물을 검토하며, '오케스트레이션(Orchestration)'으로 복잡한 작업 흐름을 조율합니다. 마지막으로 'LLMOps'와 'Langfuse'를 통해 에이전트 시스템을 운영하고 모니터링하는 방법까지 다룹니다. 이 책 《요즘 AI 루프 엔지니어링, 클로드 코드, 스킬, MCP, 훅, 컨텍스트, 하네스, 리뷰, 오케스트레이션, LLMOps, Langfuse》는 이러한 핵심 개념과 기술들을 9가지 실전 예제를 통해 상세하게 설명하여, AI 에이전트 개발의 첫걸음을 떼는 데 큰 도움을 줄 것입니다.

Q.클로드 코드(Claude Code)가 무엇인가요? 그리고 이 책에서 클로드 코드를 어떻게 활용하는지 궁금합니다.

클로드 코드(Claude Code)는 앤트로픽(Anthropic)에서 개발한 AI 모델 클로드(Claude)를 활용하여 코드를 생성하고 디버깅하며, 전체 개발 워크플로를 자동화하는 데 중점을 둔 개발 환경 및 도구들을 통칭합니다. 단순히 코드 조각을 생성하는 것을 넘어, AI가 개발 프로세스 전반에 깊이 개입하여 실제 개발자의 역할을 수행하도록 돕는 것을 목표로 합니다. 이 책에서는 클로드 코드의 핵심 개념과 구성 요소를 심층적으로 다룹니다. 특히 클로드 코드의 '스킬(Skills)' 기능을 활용하여 에이전트가 특정 작업을 수행하는 능력을 부여하고, 'MCP(Multi-agent Communication Protocol)'를 통해 여러 에이전트가 서로 소통하며 복잡한 태스크를 협업하여 처리하는 방식을 배웁니다. 또한 '훅(Hooks)'을 설정하여 에이전트의 행동을 제어하고, '컨텍스트(Context)' 관리로 에이전트가 효율적으로 정보를 활용하도록 돕습니다. 최종적으로 '하네스(Harness)'를 구축하여 에이전트가 안전하고 효율적으로 코드를 실행하고 테스트하며, '리뷰(Review)' 과정을 통해 AI가 생성한 코드의 품질을 검증하고 개선하는 방법을 제시합니다. 이 책 《요즘 AI 루프 엔지니어링, 클로드 코드, 스킬, MCP, 훅, 컨텍스트, 하네스, 리뷰, 오케스트레이션, LLMOps, Langfuse》는 클로드 코드를 활용하여 에이전트가 스스로 판단하고 작업을 이어가는 개발 환경을 구축하는 실질적인 방법을 제시합니다.

Q.AI 에이전트들이 협업해서 일을 처리하는 시스템을 만들고 싶습니다. 'MCP'나 '오케스트레이션' 같은 개념들이 어떻게 적용되는지 알고 싶어요.

AI 에이전트들이 협업하여 복잡한 작업을 처리하는 시스템을 구축하는 것은 매우 흥미롭고 강력한 접근 방식입니다. 이 책에서는 이를 가능하게 하는 핵심 개념인 'MCP(Multi-agent Communication Protocol)'와 '오케스트레이션(Orchestration)'을 심도 있게 다룹니다. MCP는 여러 AI 에이전트들이 서로 정보를 주고받고, 역할을 분담하며, 공동의 목표를 달성하기 위해 소통하는 방식과 규칙을 정의하는 프로토콜입니다. 마치 팀원들이 각자의 전문성을 바탕으로 의견을 나누고 협력하는 것과 유사합니다. 책에서는 나만의 MCP 서버를 띄우고, 에이전트들이 역할별로 나뉘어 서로 주고받으며 일하는 실전 예제를 통해 MCP의 실제 적용 방법을 보여줍니다. '오케스트레이션'은 이러한 에이전트들의 협업 흐름을 전체적으로 조율하고 관리하는 과정입니다. 즉, 어떤 에이전트가 언제 어떤 작업을 시작하고, 그 결과가 다음 어떤 에이전트에게 전달되어야 하는지 등 복잡한 작업 파이프라인을 설계하고 실행하는 것을 의미합니다. 이 책은 깃허브 이슈 생성부터 리뷰 반영까지 실제 개발 워크플로를 단계별로 자동화하는 과정을 통해, 에이전트들이 어떻게 협업하고 오케스트레이션 되는지를 구체적으로 보여줍니다. 《요즘 AI 루프 엔지니어링, 클로드 코드, 스킬, MCP, 훅, 컨텍스트, 하네스, 리뷰, 오케스트레이션, LLMOps, Langfuse》를 통해 AI 에이전트들이 스스로 할 일을 찾아 처리하는 강력한 협업 시스템을 직접 구축해 보세요.

Q.AI 에이전트가 코드를 생성하거나 시스템에 접근할 때 발생할 수 있는 위험을 어떻게 통제할 수 있을까요? '훅'이나 '하네스' 같은 기술들이 도움이 될까요?

AI 에이전트가 실제 시스템에 개입하여 코드를 생성하거나 실행할 때는 보안과 안정성 확보가 매우 중요합니다. 이때 '훅(Hook)'과 '하네스(Harness)' 같은 기술들이 강력한 통제 메커니즘을 제공합니다. '훅'은 특정 이벤트가 발생했을 때 자동으로 실행되는 코드 조각을 의미합니다. 예를 들어, 에이전트가 위험하다고 판단되는 명령을 실행하기 직전, 사전에 정의된 '훅'을 통해 해당 명령을 차단하거나 사용자에게 승인을 요청하는 등의 보안 검사를 수행할 수 있습니다. 이 책에서는 나만의 MCP 서버를 띄우고 위험한 명령을 실행 전에 차단하는 훅을 거는 방법을 실습하며 안전하게 에이전트를 운영하는 노하우를 배울 수 있습니다. '하네스'는 에이전트가 작업을 수행하는 환경을 제어하고 격리하는 도구입니다. 하네스를 사용하면 에이전트가 실제 운영 환경에 직접적인 영향을 주지 않도록 가상 환경이나 샌드박스 내에서 코드를 실행하고 테스트할 수 있습니다. 이는 에이전트의 잠재적인 오류나 악성 코드 실행으로부터 시스템을 보호하는 데 필수적입니다. 이 책 《요즘 AI 루프 엔지니어링, 클로드 코드, 스킬, MCP, 훅, 컨텍스트, 하네스, 리뷰, 오케스트레이션, LLMOps, Langfuse》는 에이전트의 기능을 최대한 활용하면서도 발생할 수 있는 위험을 효과적으로 관리하고 통제하는 방법을 구체적인 예제와 함께 제시하여, 안전하고 신뢰할 수 있는 AI 개발 시스템을 구축하는 데 필요한 지식을 제공합니다.

Q.LLMOps와 Langfuse는 AI 에이전트 시스템에서 어떤 역할을 하나요? 그리고 이 책에서는 어떻게 다루고 있나요?

LLMOps(Large Language Model Operations)는 대규모 언어 모델(LLM) 기반 애플리케이션을 개발, 배포, 운영 및 모니터링하는 전반적인 프로세스와 문화를 의미합니다. AI 에이전트 시스템을 성공적으로 운영하기 위해서는 단순한 개발을 넘어 지속적인 성능 관리와 개선이 필수적인데, LLMOps가 바로 이 역할을 담당합니다. 이는 모델 배포 자동화, 성능 모니터링, 데이터 파이프라인 관리, 버전 관리 등을 포함합니다. Langfuse는 이러한 LLMOps의 일환으로, LLM 애플리케이션의 추적, 관찰, 평가를 돕는 오픈소스 도구입니다. Langfuse를 사용하면 AI 에이전트의 프롬프트 호출, 모델 응답, 에이전트 내부의 의사결정 과정 등을 상세하게 기록하고 시각화하여 분석할 수 있습니다. 이를 통해 에이전트의 동작을 투명하게 파악하고, 성능 병목 구간을 찾아 개선하며, 문제 발생 시 빠르게 디버깅할 수 있습니다. 이 책에서는 LLMOps와 Langfuse를 활용하여 구축된 에이전트 시스템의 성능을 지속적으로 모니터링하고 최적화하는 방법을 다룹니다. 특히 에이전트 루프 시스템이 실제로 어떤 변화를 가져오는지, 그리고 그 시스템을 어떻게 효율적으로 관리하고 발전시킬 수 있는지에 대한 실질적인 가이드를 제공합니다. 《요즘 AI 루프 엔지니어링, 클로드 코드, 스킬, MCP, 훅, 컨텍스트, 하네스, 리뷰, 오케스트레이션, LLMOps, Langfuse》를 통해 AI 에이전트 시스템을 개발하는 것을 넘어, 안정적으로 운영하고 지속적으로 개선하는 노하우를 습득할 수 있습니다.

Q.프롬프트 작성만으로는 AI 자동화에 한계를 느끼고 있습니다. 이 책이 다음 단계로 나아가는 데 어떤 도움을 줄 수 있을까요?

프롬프트 작성만으로는 AI 자동화의 한계를 느끼시는 것은 매우 자연스러운 현상입니다. AI 모델의 성능이 아무리 좋아져도, 매번 사람이 개입하여 프롬프트를 수정하거나 결과를 확인해야 한다면 진정한 자동화라고 보기 어렵습니다. 이 책은 이러한 한계를 극복하고 AI가 '잘 답하는 것'을 넘어 '끝까지 일하는 것'을 만드는 방법을 제시하여 여러분을 다음 단계로 이끌어 줄 것입니다. 핵심은 '루프 시스템' 설계입니다. 즉, AI가 스스로 작업을 계획하고, 실행하며, 검증하고, 실패를 복구하고, 다음 작업으로 이어 가는 순환적인 시스템을 구축하는 것입니다. 이 책에서는 클로드 코드의 스킬, MCP, 훅, 컨텍스트, 하네스, 리뷰, 오케스트레이션, LLMOps, Langfuse 등 최신 기술들을 활용하여 에이전트가 협업하고 스스로 판단하며 작업을 이어 가는 개발 환경을 구축하는 방법을 실전적으로 다룹니다. 깃허브 이슈 생성부터 리뷰 반영까지 실제 개발 워크플로를 자동화하는 구체적인 예제를 통해, 여러분은 AI가 할 일을 스스로 찾아 처리하는 루프 컨트롤러를 직접 완성해 볼 수 있습니다. 19년 차 현업 개발자의 실전 경험을 바탕으로, 프롬프트를 넘어 시스템을 엔지니어링하는 방법을 배우고 싶다면, 《요즘 AI 루프 엔지니어링, 클로드 코드, 스킬, MCP, 훅, 컨텍스트, 하네스, 리뷰, 오케스트레이션, LLMOps, Langfuse》가 여러분이 찾던 다음 단계의 가이드가 될 것입니다.