라벨이 AI비용절감인 게시물 표시

Codex Context 관리법: /compact로 토큰 낭비 줄이고 긴 프로젝트 이어가기

이미지
Codex로 프로젝트를 오래 진행할수록 대화창에는 이전 지시, 파일 탐색 결과, 오류 로그가 계속 쌓인다. 이 글에서는 컨텍스트를 줄이는 기능 과, 긴 프로젝트를 안정적으로 이어 가는 실전 작업 흐름을 정리한다. Context가 길어지면 왜 불편할까? 컨텍스트(Context)는 Codex가 현재 작업을 위해 참고하는 정보의 묶음이다. 이전 대화, 지시사항, 읽은 파일, 명령 실행 결과, 오류 로그 등이 포함된다. 그래서 “아까 만든 기능을 조금 수정해줘” 같은 요청을 이해하기 편하다. 하지만 대화가 길어질수록 이미 끝난 논의와 긴 로그까지 함께 남는다. 지금의 작업과 관계없는 정보가 많아지면, 같은 파일을 반복해서 확인하거나 과거 결정과 충돌하는 제안을 할 가능성도 커진다. 핵심은 대화를 무조건 이어 가는 것이 아니라, 필요한 정보만 남겨서 이어 가는 것 이다. 가장 간단한 방법: /compact Codex CLI를 사용 중이라면 대화가 길어졌을 때 아래 명령을 입력할 수 있다. /compact /compact 는 지금까지의 긴 대화를 핵심 요약으로 바꾸는 기능이다. 프로젝트의 중요한 결정, 현재 진행 상태, 남은 작업은 가능한 한 유지하면서 오래된 세부 대화와 긴 출력 내용을 줄인다. 예를 들어 이미지 변환 기능을 구현하며 오류 로그를 여러 번 확인했다면, 그 모든 로그를 들고 가는 대신 “이미지 변환 기능 구현 완료, 브라우저 내 처리 방식 사용, 특정 형식의 예외 처리 보완 필요”처럼 압축된 정보만 남긴다. 알아둘 점: Codex는 대화가 길어지면 자동으로 압축하기도 한다. 다만 기능 하나가 끝났을 때 직접 /compact 를 실행하면 작업 전환 시점을 더 깔끔하게 정리할 수 있다. /compact 는 Codex CLI의 슬래시 명령이다. Codex 앱을 사용한다면 같은 목적을 위해 새 작업을 시작하고, 아래의 인수인계 문서를 활용하는 방식이 가장 확실하다. /compact ...

Fable 5를 Opus 4.8보다 더 저렴하게 쓰는 방법

이미지
이 내용은 인공지능 자율 엔지니어 데빈(Devin)을 만드는 개발사 Cognition이 공식 테크 블로그에 게시한 분석 리포트를 기준으로 만들어졌습니다. 🔑 핵심 요약 Devin Fusion : 비싸고 똑똑한 " 리드 " 모델 + 저렴한 " 사이드킥 " 모델이 짝을 이뤄 작업하는 하이브리드 AI 코딩 에이전트 구조 이 구조만으로 프론티어급 성능을 유지하며 비용 35% 절감 최신 모델 Fable 5 를 리드로 쓰자 절감폭이 41% 까지 확대 — 토큰 가격은 Opus보다 2배 비싼데도 실제 실행 비용은 더 낮았음 Opus 는 인턴을 관리하는 마이크로매니저 처럼 행동하는 반면, Fable 은 유능한 엔지니어를 둔 관리자 처럼 행동합니다. 결론: 모델 가격보다 중요한 건 일을 얼마나 잘 나눠 맡기는가 — 앞으로 값이 나가는 건 "판단력" 그 자체 Devin Fusion이란? 똑똑하지만 비싼 모델( 리드 )이 팀장 역할을, 저렴하고 빠른 모델( 사이드킥 )이 실무자 역할을 맡는 구조입니다. 리드는 계획을 세우고 결과를 검토·커밋하며, 실제 구현·테스트 같은 작업은 자연어 지시서(브리프)로 사이드킥에게 넘깁니다. 기존의 단순 라우팅(쉬운 질문은 싼 모델, 어려운 질문은 비싼 모델)과 달리, 하나의 작업 안에서 두 모델이 실시간으로 협업 한다는 점이 다릅니다. 결과: 성능 그대로, 비용 35~41%↓  Devin Fusion 아키텍처의 협업 흐름. Source: Cognition 협업 플레이북 작동 원리 (역할 분담) 메인 모델 (Claude Fable 5)의 역할 — 고수준 판단 및 기획 전체 코드베이스(저장소)를 아주 가볍게 탐색하여 맥락을 파악하고 지도(Map)를 그립니다. 구체적인 기술 명세(High-level constraints)와 규칙을 담은 정교한 지시서(Bri...

Claude Code에서 Fable 오케스트레이션으로 토큰 최대 5~10배 절약하기

이미지
1. 왜 토큰이 문제가 되는가 Claude Code로 하루 종일 작업하다 보면 어느 순간 “왜 이렇게 한도가 빨리 닳지?”라는 생각이 든다. 원인은 단순하다. 가장 똑똑한 모델일수록 토큰 단가가 비싸고, 코딩 작업의 대부분은 사실 그 정도의 추론 능력을 필요로 하지 않기 때문이다. Anthropic 공식 가격 정책 기준으로 보면 격차가 뚜렷하다. 모델 입력 (1M 토큰당) 출력 (1M 토큰당) Claude Fable 5 $10 $50 Claude Opus 4.8 $5 $25 Claude Sonnet 5 (2026년 8월 31일까지 도입가) $2 $10 Fable 5는 Opus 4.8의 2배, Sonnet의 5배에 달하는 단가다. 게다가 Fable 5를 포함한 최신 모델은 이전 세대보다 약 30% 더 많은 토큰을 소모하는 토크나이저를 쓰기 때문에, 같은 텍스트라도 체감 비용은 더 커진다. 문제는 단가만이 아니다. Claude Code에서 세션 하나가 파일을 읽고, 테스트를 돌리고, 로그를 확인하고, 다시 코드를 고치는 과정을 전부 최상위 모델 혼자 처리하면, 정작 “판단”에 쓰이는 토큰보다 “노동”에 쓰이는 토큰이 훨씬 많아진다. 파일 40개짜리 리팩터링을 처음부터 끝까지 Fable 혼자 맡기면, 정작 어려운 설계 판단을 하기도 전에 일일 한도나 주간 사용량을 다 써버리는 일이 흔하다. 그래서 나온 발상이 “ 오케스트레이션(orchestration) ”이다. 비싼 모델은 생각만 하고, 실제 손을 쓰는 작업은 싼 모델에게 맡기자는 것이다. 2. Fable 오케스트레이...

Claude Code 토큰 절약 가이드

이미지
왜 토큰이 빨리 소모될까? 메시지를 보낼 때마다 이전 대화 전체(프롬프트, 응답, 도구 실행 결과 전부)가 처음부터 다시 전송되어 처리된다. 즉 토큰 사용량은 "내가 방금 입력한 양"이 아니라 세션이 시작된 이후 오간 모든 내용의 누적량 이다. 특히 Claude가 도구를 써서 파일을 읽거나 diff를 가져올 때마다 그 결과 전체가 대화 기록에 그대로 끼어들기 때문에, 무심코 큰 파일을 여러 개 읽게 하면 순식간에 컨텍스트가 불어난다.  💡 아래 명령어들은 모두 Claude Code를 실행 중인 터미널(또는 VS Code 통합 터미널) 안에서, 그냥 타이핑하고 Enter를 누르면 된다. 목차 01 세션 관리 02 CLAUDE.md 다이어트 03 작업에 맞는 모델 선택 04 MCP 서버 오버헤드 05 훅·스킬로 전처리 위임 06 서브에이전트 위임 07 확장 사고 조정 08 구체적인 프롬프트 09 Plan Mode + 조기 수정 10 코드 인텔리전스 플러그인 11 에이전트 팀 주의사항 12 서드파티 커뮤니티 도구 + 사용량 확인 방법 + 참고 자료 01 세션 관리 — 컨텍스트를 주기적으로 비우기 Claude Code는 세션이 길어질수록 이전에 시도했다 실패한 접근, 이미 해결된 에러, 더 이상 필요 없는 파일 내용까지 계속 컨텍스트에 들고 있는다. 아침에 시작한 세션을 점심 이후까지 그대로 이어가면, 실제로 지금 필요한 정보보다 "죽은 무게(dead weight)"가 더 많아질 수 있다. /clear 는 이 무게를 완전...