왜 AI 에이전트에게 RL 연구를 맡겨야 할까요?

솔직히 말하면, RL(강화학습) 연구는 의미 있는 지표가 나오기까지의 셋업 비용이 너무 큽니다. 저장소 클론하고, 의존성 맞추고, GPU 메모리 잡고, 체크포인트 경로 정리하고... 정작 연구 아이디어를 검증할 시간은 없어요.

그런데 최근 코딩 에이전트들이 이 "지루한 인프라 작업"을 꽤 잘 해냅니다. 저장소를 살펴보고, 런타임을 세팅하고, 빌드 에러를 해결하고, 실험을 띄우고, 메트릭을 분석해서 요약까지 해줘요.

이 글에서는 NVIDIA NeMo RL + NeMo Gym + Codex(GPT 5.5) + Brev GPU 인스턴스 조합으로, 사용자가 코드를 거의 안 짜도 되는 autoresearch 워크플로우를 단계별로 정리해봤어요. 실제로 검증된 시나리오라서 그대로 따라 하시면 됩니다.

핵심 원칙: autoresearch의 목적은 연구자를 루프에서 빼는 게 아니라, 반복적인 셋업과 이터레이션을 에이전트에게 위임하는 거예요. 목표 설정, 마일스톤 리뷰, 전략 수정, 최종 판단은 여전히 사람 몫입니다.


사전 준비물

  • VS Code + Codex 플러그인(GPT 5.5 모델)
  • NVIDIA Brev 인스턴스 (L40S 48GB GPU 1장)
  • NeMo RL 저장소 (Brev Launchable 사용 시 /home/ubuntu/RL에 사전 클론됨)
  • Hugging Face / Weights & Biases 자격증명 (모델·데이터셋·로깅 접근용)

Developer configuring Codex AI agent inside VS Code to run autoresearch RL training workflow Development Concept Image

3가지 에이전트 역량, 10단계로 검증하기

이 워크플로우가 검증하는 에이전트 역량은 딱 3가지예요.

  1. Full-stack autonomy: 소프트웨어 스택 셋업, 의존성 해결, GPU 메모리/디스크/체크포인트 관리, 실험 실행, 모니터링, 디버깅
  2. Goal-driven autoresearch: 베이스라인 프로파일링 → 가설 수립 → 실험 → 메트릭 분석 → 목표까지 이터레이션
  3. Paper-to-code: 논문 읽고 → 구현 계획 세우고 → 알고리즘을 코드로 변환 → 테스트 추가 → 검증 학습 시작

Step 1~4: 인스턴스 띄우고 Codex 붙이기

Brev Launchable로 L40S 인스턴스를 띄우고, VS Code의 SSH config에 호스트를 추가하세요. Windows 기준 C:\Users\<user>\.ssh\config에 아래처럼 넣으면 됩니다.

Host Brev-Ubuntu
  HostName <BREV_IP_ADDRESS>
  User ubuntu
  IdentityFile C:/Users/<user>/.brev/brev.pem

VS Code에서 Connect to Host → Brev-Ubuntu 선택. 그 다음 Codex IDE 확장을 설치하고, API 키 또는 ChatGPT 계정으로 로그인하세요.

권한 모드는 Auto-Review부터 시작하는 걸 추천해요. 샌드박스 명령은 실행하되, 권한 상승이 필요한 액션은 리뷰를 거치는 모드입니다. Full Access는 편하지만 보안 감각이 확실할 때만 쓰세요.

Step 5: NeMo RL 스모크 테스트

Codex에게 /goal 커맨드로 지속 목표를 던져줍니다.

/goal Use the nemo-rl-brev-etiquette skill under `./skills`, set up NemoRL to
 do a smoke test RL training of the Qwen3-VL-2B-Instruct model

Codex가 알아서 해줘야 하는 것들:

  • Brev 운영 스킬 로드
  • NeMo RL 서브모듈 초기화
  • Hugging Face에서 Qwen3-VL 모델 다운로드
  • 대용량 자산(HF, Torch, Triton, uv, Ray, 로그, 워커 캐시)을 /ephemeral로 라우팅
  • 의존성/설정 이슈 해결 후 학습 스텝 1회 완료

걸리는 시간은 대략 40분~1시간. 목표는 "최적화된 셋업"이 아니라 저장소 셋업 → 모델 접근 → 의존성 해결 → 학습 실행까지 end-to-end 경로 검증이에요.

Step 6: 세션 메모리로 상태 저장

Now use the nemo-rl-session-memory skill under `./skills`, persist this setup information

네트워크 끊김, VS Code 재시작 후에는 아래처럼 복원하면 됩니다.

Use the nemo-rl-session-memory skill under `./skills`, load the latest session, and provide me with a summary

Step 7~8: 신규 Gym 환경 만들고 캠페인 시작

/goal Now using the Nemo gym circle click environment as a reference,
implement a new Gym environment named "star count", that teaches
a model to count the number of stars of different colors on a canvas of
different resolutions. Show me several examples

그 다음 시간 제한을 걸고 캠페인을 돌립니다.

/goal Now use the nemo-rl-autoresearch and nemo-rl-session-memory skill under `./skills`,
start a new auto research session, goal: Train the Qwen3-VL-2B-Instruct model to high accuracy,
using SFT algorithm on the star count gym environment.
Start with profiling the model out of the box accuracy. Time budget: 5h

중요: 프롬프트에 목표·방법·태스크 환경·베이스라인 요구사항·시간 예산이 반드시 들어가야 해요. autoresearch 스킬이 이걸 측정 가능한 stop rule과 실험 원장(ledger)으로 변환해줍니다.

실제 결과 (star count SFT 캠페인)

  • 베이스라인(고정 64-example held-out eval split): 25.0% exact accuracy, mean reward 0.705
  • 첫 LoRA 스모크 런: 78.125%
  • 2048-train/256-val 160-step 런: 95.3125%
  • 4096-train/512-val 320-step 런: 96.875% (mean reward 0.992)
  • 최고 체크포인트는 step_240

총 +71.875%p 상승. 남은 에러는 포맷 실패가 아니라 특정 색상의 off-by-one 카운트 실수였어요. 그래서 다음 실험 방향은 dense/visually ambiguous scene에 대한 hard-case augmentation이 자연스럽게 도출됩니다.

Step 9~10: Paper-to-code

논문 하나 던져줍니다. 예시는 LLMs Can Learn to Reason via Off-Policy RL (OAPL 알고리즘).

/goal Start a new session with nemo-rl-session-memory skill under `./skills`. First, read
this paper https://arxiv.org/abs/2602.19362 in pdf format, form a plan then implement it.
Write and run unit tests to satisfaction. Write document. Then start a new autoresearch
session with the nemo-rl-autoresearch skill, train a Qwen3-1.7B model with this algorithm
on the DAPO-math-17K dataset. Time budget: 10h

Codex가 쪼개서 처리하는 단계:

  1. PDF 읽기 → 2. 알고리즘 추출 → 3. NeMo RL 훅 지점 조사 → 4. 구현 계획 → 5. 코드 변환 → 6. 유닛 테스트 → 7. 문서화 → 8. Qwen3-1.7B + DAPO-math-17K 검증 캠페인

⚠️ 실무 조언: 위 프롬프트는 의도적으로 빡셉니다. 실제로는 단계별로 나눠서 가세요. (1) 읽기+계획 → 사람 리뷰, (2) 구현+테스트+문서 → 승인, (3) 마지막에 autoresearch 검증 캠페인. 이게 훨씬 안전합니다.

NVIDIA Brev GPU instance terminal showing NeMo RL smoke test training logs

실패 모드와 주의사항

에이전트가 강력해졌다고 해도, 다음 패턴은 반드시 경계하세요.

실패 모드증상대응
Context drift컨텍스트 압축을 여러 번 거치며 목표·로드된 스킬·stop rule을 잊음session-memory 스킬로 durable diary 유지
Local housekeeping로그·체크포인트·데이터셋이 파일시스템 여기저기 흩어짐머신별 etiquette 스킬로 경로 규칙 명시
Steering drift중간 지시가 오히려 세션을 조기 종료시킴장시간 캠페인 중엔 개입 최소화
Low-signal loops스텝 수가 너무 적거나 배치가 너무 작아 신호가 안 잡힘사람이 개입해서 방향 전환

한국 개발 생태계에서의 적용 맥락

국내에서 이 워크플로우를 돌릴 때 특히 신경 써야 할 부분이 있어요.

  • GPU 자원 확보: Brev 같은 클라우드 GPU 인스턴스가 편하지만, 국내 규제/과금 이슈로 온프레미스(NCP, 네이버 클라우드 GPU)로 옮겨야 하는 경우가 많아요. 이때는 brev-etiquette 스킬을 자체 인프라용으로 다시 작성해야 합니다.
  • 폐쇄망 환경: 사내 보안 정책상 Hugging Face 직접 다운로드가 막혀 있는 경우가 흔합니다. 미러 레지스트리 경로를 스킬에 명시해두면 에이전트가 알아서 우회합니다.
  • 로그/실험 추적: W&B가 막혀 있으면 MLflow나 사내 실험 트래커로 라우팅하도록 스킬을 커스터마이즈하세요. 안 그러면 에이전트가 학습을 다 돌리고도 결과를 못 남깁니다.

이 기술의 한계

  • 에이전트는 연구자가 아닙니다. Codex를 "유능한 인턴" 정도로 생각하세요. 코드 한 줄 한 줄을 다 이해할 필요는 없지만, 방법론을 검증할 능력은 사람에게 있어야 해요.
  • 장시간 캠페인은 반드시 예산을 명시하세요. 시간 제한, GPU-hour 예산, 최대 실험 횟수 중 최소 하나는 걸어두지 않으면 실험 스윕이 통제 불능이 됩니다.
  • Paper-to-code는 아직 위험합니다. 알고리즘 구현이 미묘하게 틀려도 학습이 "그럭저럭" 돌아가서 문제를 늦게 발견할 수 있어요. self-consistency(두 브랜치에서 각각 구현 후 비교)나 다른 에이전트의 cross-check를 반드시 넣으세요.

다음 단계 학습 방향

  1. Agent Skills 문서화 — NVIDIA의 verified Agent Skills 문서와 NVIDIA/skills GitHub 저장소를 훑어보세요. NeMo RL Auto Research 스킬이 레퍼런스로 좋습니다.
  2. NeMo Gym 환경 직접 만들기 — star count 예제처럼 도메인 특화 환경을 직접 구현해보면 에이전트가 뭘 잘하고 못하는지 감이 옵니다.
  3. 스킬을 살아있는 문서로 취급 — 스킬은 한 번 쓰고 마는 게 아니라, 매 실행에서 얻은 교훈을 반영해 계속 업데이트해야 해요. Codex가 스킬 자체를 리팩터링하는 것도 가능합니다.

Reinforcement learning accuracy chart improving from 25 percent to 96.9 percent on star count task Algorithm Concept Visual

마무리: 에이전트는 연구자를 대체하지 않습니다

정리하면 이렇습니다.

  • 에이전트가 하는 일: 셋업, 디버깅, 로깅, 실험 루프 실행, 다음 단계 제안
  • 연구자가 하는 일: 목표 정의, 도메인 판단, 캠페인 조종, 어떤 결과가 의미 있는지 결정

NeMo RL + NeMo Gym + Brev + Codex + 소수의 운영 스킬 조합이면, 셋업·디버깅·반복 실험에 쓰던 시간과 컴퓨트를 크게 줄일 수 있어요. 절약한 리소스는 **"다음에 뭘 실험할 가치가 있는가"**를 고민하는 데 쓰면 됩니다.

바로 시작해보고 싶다면:

  • Brev Launchable로 튜토리얼 환경 그대로 띄워보기
  • NVIDIA/skills 저장소에서 NeMo RL Auto Research 스킬 살펴보기
  • NeMo RL / NeMo Gym 공식 문서 훑어보기

근거자료는 NVIDIA Developer Blog의 원문에서 확인하실 수 있어요.

함께 보면 좋은 글

본 콘텐츠는 신뢰할 수 있는 출처를 바탕으로 AI 도구를 활용하여 초안이 작성되었으며, 편집자의 검토를 거쳐 발행되었습니다. 전문가의 조언을 대체하지 않습니다.