Skip to main content Link Menu Expand (external link) Document Search Copy Copied

헤르메스 에이전트 — 자가 발전이 핵심인 이유

레인 | AI 바이브코딩 채널의 헤르메스 에이전트 소개 영상을 보고, 개념만 골라 적어 둔 학습 메모다. 설치·클릭·토큰 절차는 다루지 않는다.
초안 작성·문장 정리에 AI를 사용했다. 해석은 작성자 것이며 영상과 다를 수 있다. 아래 외부 연구 사례의 수치·주장은 각 논문·프로젝트에 따른다.

이 영상이 푸는 문제

같은 프롬프트를 넣어도 LLM 답이 들쭉날쭉하다. 일주일 쓴 비서와 한·두 달 쓴 비서가 같다면, 업무 맥락이 쌓여도 품질이 안 올라가는 문제에 가깝다.

발표자가 헤르메스를 들인 이유는 여기다. 쌓아 둔 맥락을 자가개선 루프 안에서 돌려, 결과를 더 일관되게 뽑고 싶어서다. 클로드 코드에 없다고 본 중요 기능도 바로 이 자가 발전이다. 모델만 바꾸면 해결되지 않는다. 반복을 붙잡고, 메모리를 정리하고, 스킬로 굳히는 운영 루프가 있어야 한다.

핵심 두 갈래

헤르메스는 스스로 발전하는(자가 발전) AI 에이전트로 소개된다. 업무·프로세스 맥락이 쌓일수록 시스템이 더 잘 돈다고 한다. 축은 둘이다.

  1. 지속형 메모리 — 한 일뿐 아니라 사용자 정보·선호를 기억해 답변을 맞춘다.
  2. 셀프 임프루빙 스킬 — 대화에서 반복 워크플로를 발견하면, 요청하지 않아도 그 과정을 스킬로 만들어 저장·재사용한다.

메모리는 무한히 커지지 않게 한도를 둔다. 한도에 닿으면 모델이 내용을 검토해 덜 중요한 것은 버리고 중요한 것만 남긴다. 사람에게 정보가 한꺼번에 몰리면 집중이 떨어지는 것에 비유한다. 「패턴 → 스킬」과 「메모리 정리」가 한 세트인 이유다.

다른 도구와 어떻게 다른가 (영상 기준)

클로드 코드는 대화형·코딩 에이전트에 가깝고, 발표자가 강조하는 자가 발전(반복→스킬, 메모리 정리 루프) 은 없다고 본다.

오픈 클로와는 기본 기능이 비슷하되, 차이는 이렇게 정리한다.

  오픈 클로 헤르메스
성격 채널·메신저를 묶어 에이전트가 소통하게 하는 멀티오케스트레이터에 가깝다 반복 아웃풋을 재해석하고 작업을 스킬화하는 자가 발전이 녹아 있다
메모리 이런 정리 프로세스가 없고 메모리가 계속 증가한다고 전함 한도·검토·정리로 노이즈를 줄인다

어느 쪽이 절대적으로 낫다고 단정하지는 않는다. 「맥락을 쌓아 자가 발전시키고 싶을 때」 헤르메스를 추천한다고 한다.

여기까지가 영상 안의 좌표다. 같은 문제가 연구·오픈소스에도 이미 있으므로, 시연으로 들어가기 전에 바깥 사례를 먼저 놓고, 그다음 영상 샘플로 돌아오는 편이 읽기 쉽다.

바깥의 자가 발전 루프 (외부 사례)

헤르메스 영상만의 발명이 아니다. 시행 피드백을 언어·코드로 남기고, 다음 시도에 다시 쓰는 루프는 논문·프로젝트에도 있다. 수치·평가는 각 출처 주장이다.

Reflexion — 말로 남기는 반성 메모리

Reflexion(Shinn et al., NeurIPS 2023)은 가중치를 바꾸지 않고, 과제 피드백을 언어로 반성(reflection) 한 뒤 그 텍스트를 에피소드 메모리에 넣어 다음 시도의 결정을 낫게 한다. 코딩·추론·순차 결정 등에서 보고되었고, 논문은 HumanEval pass@1에서 Reflexion 91% vs 당시 GPT-4 80%를 든다. 헤르메스의 “쓸수록 낫다”와 겹치는 축은 실패·피드백을 다음 프롬프트에 붙이는 것이고, 차이는 Reflexion이 태스크 트라이얼 단위의 연구 프레임에 가깝다는 점이다.

Voyager — 실행·검증 후 스킬 라이브러리

Voyager(Wang et al., 2023)는 마인크래프트에서 프로그램을 실행하고, 환경 피드백·에러를 넣어 코드를 고친 뒤, 자기 검증이 통과하면 스킬 라이브러리에 커밋한다. 스킬은 검색·조합 가능하고, 논문은 기존 대비 고유 아이템 약 3.3배, 기술 트리 마일스톤 최대 약 15.3배 빠른 해금 등을 보고한다. 헤르메스의 「반복 → 스킬」과 가장 닮은 외부 그림이다. 다만 Voyager는 게임 환경의 평생 학습 에이전트이고, 헤르메스 소개는 일상 비서·메신저·칸반 제품 서사다.

SAGE — 반성 + 망각 곡선형 메모리

SAGE(Self-evolving Agents with Reflective and Memory-augmented Abilities)는 Assistant·Checker 피드백과 반성, 그리고 에빙하우스식 망각 곡선으로 단기·장기 메모리를 다루는 프레임을 제안한다. 벤치·장문 과제에서 성능 향상을 보고한다. 헤르메스의 메모리 한도·재검토·삭제와 문제 의식이 닿는다 — 쌓기만 하면 노이즈가 된다.

(참고) 이 블로그에서 겹쳐 본 운영 루프

연구 프레임과 별도로, 이미 적어 둔 운영 사례와도 축이 겹친다. Whop 오퍼레이터는 손이 성공을 확인한 뒤 Skill·Routine으로 굳히고, Astra×Obsidian은 사람이 effort 티어·인용 규율로 루프를 조립한다. 헤르메스 영상이 미는 것은 그중에서도 제품 안에 반복→스킬·메모리 정리가 들어가 있다는 쪽에 가깝다.

사례 반복을 붙잡는 주체 굳히는 단위 성격
Reflexion 에이전트 + 태스크 피드백 반성 텍스트(에피소드 메모리) 연구 프레임
Voyager 실행·검증 루프 코드 스킬 라이브러리 연구·오픈 에이전트
SAGE Checker·반성 단기/장기 메모리(+망각) 연구 프레임
헤르메스 (영상) 대화에서 반복 발견 스킬 + 메모리 한도 정리 제품 소개
Whop / vault 메모 사람 확인·프로토콜 Skill·Routine / effort·인용 운영 조립

공통점은 모델 교체만으로 일관성을 사지 않는다는 것이다.

영상으로 돌아오면: 개념 특징과 시연

바깥 지도를 본 뒤, 영상이 실제로 보여 주는 층이다.

  • 상주 환경(개념). 랩탑과 분리된 24시간 상주를 전제로 이야기한다.
  • 메신저·예약·칸반. 메신저로 소통하고, 예약 작업을 걸며, 칸반으로 한 줄 아이디어를 여러 Todo로 쪼개 돌릴 수 있다고 시연한다.
  • 모델 선택 관점. 여러 LLM을 붙일 수 있고, 구독 한도 안 / 쓴 만큼 과금 / 더 저렴한 모델 여부가 선택 기준이라고 한다.

시연 샘플:

  • 반복 업무 → 스킬·맥락. 상품·키워드·가격·리뷰에서 지정에 맞게 키워드를 뽑는 의뢰. 제품 정보를 더 줄수록 자가 개선이 된다고 한다.
  • 상주 비서 + 예약. 메신저로 대화를 이어 가고, 「매일 특정 시각에 핵심 뉴스 한 건」 같은 예약을 거는 모습.
  • 칸반으로 한 줄 → 여러 단계. 「키워드 추출하고 싶어」 수준의 아이디어를 넣으면 상품 소싱·키워드 추출 등으로 Todo가 나뉘고, 클릭률·마진·로아스 등 결과까지 이어지는 시연. 채 10분도 안 되어 경로가 진행됐다고 한다.

시연이 말하는 바는 “마법처럼 똑똑해진다”보다, 거친 요청을 쪼개고·반복을 붙잡고·예약으로 루프를 돌린다는 쪽에 가깝다. Voyager·Reflexion이 실험실에서 보여 준 “피드백 → 저장 → 재사용”을, 이 영상은 비서·칸반 UX로 옮겨 보여 준다고 읽으면 된다.

한계 (풀어서)

같은 프롬프트라도 결과가 흔들릴 수 있는 LLM 한계는 여전하다. 자가개선이 필요하다고 말하는 이유이기도 하고, 루프가 있어도 완전 고정 품질을 보장하지는 않는다는 뜻이기도 하다. Reflexion·Voyager의 벤치 숫자도 그 과제·환경에 묶여 있으니, 헤르메스 데모의 “10분 안”과 직접 등치하면 안 된다.

메인 PC에 24시간 상주는 보안·개인정보 이유로 비권장이라고 한다. 분리된 상주 환경 전제는 편의와 동시에 운영·보안 책임을 밖으로 옮긴다. 일부 모델은 구독 한도 밖에서 과금이 커질 수 있고, 터미널·게이트웨이 쪽은 불친절할 수 있다고 한다.

남기는 한 줄

헤르메스를 개념으로 읽으면, 제품 나열이 아니라 「반복을 스킬로 만들고, 메모리를 정리하며, 쌓인 맥락으로 일관성을 끌어올리는」 자가 발전 루프가 중심이다. 모델 교체만으로는 그 루프가 생기지 않는다. 바깥의 Reflexion·Voyager·SAGE와 나란히 두면, 헤르메스 영상의 포인트는 그 루프를 일상 비서 제품 서사 안에 넣었다는 데 가깝다.

외부 출처 (사례)

  • Shinn et al., Reflexion: https://github.com/noahshinn024/reflexion · NeurIPS 2023
  • Wang et al., Voyager: https://voyager.minedojo.org/ · https://arxiv.org/abs/2305.16291
  • SAGE: https://arxiv.org/abs/2409.00872

영상·설명은 수집 시점 기준. 학습용 개념 정리. 벤치 수치는 각 논문 주장. AI 보조 작성.

댓글