free-claude-code로 Ox Alpha 실전 사용: 실제 프로젝트 코드 품질은 6/10이었다
이 글을 읽으면 얻을 수 있는 것
무료 Ox Alpha가 실제 프로젝트 코드까지 맡길 만한지 확인했다.
- 구조·타입·보안은 괜찮았지만 핵심 알고리즘과 운영 경계 조건은 부족했다.
- GPT-5.6 Sol의 실제 코드 리뷰 점수는 6/10이었다.
- 공개 평판과 한 프로젝트의 검증 결과를 구분해 판단할 수 있다.
무료 코딩 모델의 평가는 흔히 두 극단으로 갈린다. “유료 최상위 모델보다 낫다”는 체감 평가가 있는가 하면, 간단한 벤치마크에서는 평범한 결과가 나오기도 한다. 그래서 이번에는 모델 소개만 읽지 않고 free-claude-code를 설치해 Ox Alpha를 온라인 무료 게임·도구 프로젝트의 실제 기능 구현에 적용한 뒤, 결과물을 GPT-5.6 Sol에 다시 리뷰시켰다.
이번 글은 Ox Alpha 전체를 대표하는 벤치마크가 아니다. Windows x64 환경에서 진행한 한 프로젝트의 PDF→Markdown 기능 구현 사례와 공개 사용자 반응을 함께 본 기록이다. free-claude-code 자체 버전과 프롬프트 전문은 기록에서 확인되지 않아 추측하지 않았다.
Ox Alpha는 지금 무엇으로 확인됐나
Ox Alpha는 처음에는 제작사를 밝히지 않은 ‘스텔스 모델’로 OpenRouter와 OpenCode에 공개됐다. 당시 OpenRouter는 코딩, 장시간 에이전트 작업, 프로덕션 워크로드를 겨냥한 추론 모델로 소개했고 1,048,576토큰 컨텍스트를 표시했다. 2026년 8월 27일 현재 Z.ai는 Ox Alpha가 GLM-5.3-Flash의 익명 프리뷰였다고 공식 확인했다.
free-claude-code(FCC)는 Anthropic의 공식 제품이 아니라 독립 오픈소스 프로젝트다. 여러 공급자의 모델을 Claude Code, Codex, OpenCode 같은 코딩 에이전트에 연결하는 로컬 게이트웨이에 가깝다. 공식 저장소는 공급자별 무료 한도와 제공 여부가 바뀔 수 있다고 명시한다. ‘free’는 영구 무제한을 보장한다는 뜻이 아니다.
Windows에 free-claude-code를 설치하고 Ox Alpha를 연결한 과정
테스트 환경은 Windows x64였고, 2026년 8월 24일 PowerShell에서 공식 README의 설치 명령을 실행했다.
& ([scriptblock]::Create((irm "https://raw.githubusercontent.com/Alishahryar1/free-claude-code/main/scripts/install.ps1")))
설치 프로그램에서 fcc-codex용 Codex만 선택하고 나머지 에이전트와 RTK는 선택하지 않았다. 설치 로그에는 Codex CLI 0.149.1, Windows x64 감지, 이후 PowerShell 세션을 위한 PATH 갱신이 기록됐다. 설치 화면에는 Windows 사용자명과 임시 경로가 포함돼 있어 게시할 때는 해당 부분을 가리거나 설치 명령만 싣는 편이 안전하다.
FCC Admin의 Providers 화면에서 OpenRouter가 CONFIGURED 상태인지 확인했다.
이어서 Model Config의 Default Model을 open_router/stealth/ox-alpha로 지정하고 모델별 Override는 None으로 두었다.
프로젝트 폴더에서 fcc-codex.exe를 실행하자 Codex 0.149.1 시작 화면에 open_router/stealth/ox-alpha와 reasoning medium이 표시됐다. world-writable scan을 완료하지 못해 Agent mode 보호를 검증할 수 없다는 경고도 나타났다. 모델 연결 실패가 아니라 보호 상태를 확인하지 못했다는 보안 경고이므로 그대로 기록했다.
사람들의 평가는 왜 엇갈렸나
공개 반응의 공통분모는 ‘가격 대비 성능’이다. Stripe CEO Patrick Collison은 초기 프리뷰를 “very impressive”라고 평가했다. Reddit에는 복잡한 문제를 다른 모델보다 빨리 해결했다거나, 무료 기간을 감안하면 인상적이었다는 경험담이 올라왔다. 반면 같은 스레드에서도 복잡한 작업은 Sol·Opus급이 아니라 Terra·Luna급에 가깝다는 반론이 나왔다.
한 Elixir 커뮤니티 사용자는 긴 작업에서 반복 루프에 빠졌다고 적었고, 다른 사용자도 세션 중간 멈춤을 확인했다. 에이전트와 스킬 구성을 바꾸자 문제가 줄었다는 후기도 있었다. 이는 모델만이 아니라 하네스, 도구 사용 방식, 컨텍스트 구성도 결과에 영향을 준다는 뜻이다.
독립 LiveCodeBench v6 테스트에서는 도구나 에이전트 없이 175 문제를 한 번씩 풀게 했을 때 Pass@1 28%(49/175)가 보고됐다. 이 수치는 원시 코드 생성 능력을 보여주는 한 사례일 뿐, 저장소를 읽고 도구를 사용하는 에이전트 성능과 동일하지 않다.
실제 프로젝트에서는 무엇을 구현했나
Ox Alpha에는 기존 온라인 프로젝트의 PDF→Markdown 기능을 맡겼다. 결과물에는 PDF 파서, 순수 변환 로직, UI 컴포넌트가 분리돼 있었고 도구 Registry, SEO 메타데이터, 한·영 안내도 추가됐다. PDF는 서버로 보내지 않고 브라우저에서 처리하도록 설계됐다.
검증 기록상 npm test는 43개 모두 통과했고, TypeScript 검사와 빌드도 통과했다. lint 오류는 없었으며 기존 layout.tsx 경고 1건만 남았다. 정적 생성과 브라우저 초기 렌더링도 확인됐다. any를 피한 타입 가드, 오류 타입, PDF.js 작업 정리, HTML 주입을 피한 출력 방식도 좋은 부분이었다.
실제 로컬 초기 화면에는 PDF 선택, 드래그 앤 드롭, 브라우저 내부 처리 안내, 변환 버튼과 Markdown 미리보기 영역이 표시됐다.
22.83MB 크기의 UI.pdf를 넣자 Converted 2 pages to Markdown. 성공 메시지와 함께 제목, 소제목, 목록이 Markdown 미리보기에 나타났고 Copy와 Download 버튼도 활성화됐다. 다만 원문의 유지한다.가 유지한과 다.로 갈라져 보여, 변환 성공과 별개로 줄·문단 결합 문제도 확인됐다.
GPT-5.6 Sol은 왜 6/10을 줬나
Sol의 코드 리뷰는 전체 품질을 6/10, 구조가 좋은 베타 이전 단계로 평가했다. 구조와 타입·보안은 양호했지만 핵심 변환 알고리즘과 성능·동시성 안정성이 부족했다.
| 평가 영역 | Sol 평가 | 판단 |
|---|---|---|
| 파일·컴포넌트 구조 | 7.5/10 | 역할 분리는 양호 |
| TypeScript·보안·브라우저 처리 | 8/10 | 타입과 로컬 처리 설계는 강점 |
| 핵심 변환 알고리즘 | 4.5/10 | 문단·페이지 구조 보존 실패 |
| 성능·동시성 안정성 | 4.5/10 | 대형 파일과 파일 교체 상태에 취약 |
| 테스트 품질 | 5.5/10 | 실사용 반례 부족 |
| 종합 | 6/10 | MVP·알파에는 가능, 완성품에는 부족 |
가장 큰 문제는 페이지와 문단 경계가 사라지는 것이었다. 모든 페이지의 텍스트를 펼친 뒤 제목이나 목록이 아닌 줄을 하나의 문단으로 합쳐, 서로 다른 페이지의 문장이나 500pt 떨어진 문단도 이어질 수 있었다.
변환 중 새 파일을 드롭했을 때 선택 파일, 실제 변환 결과, 다운로드 파일명이 서로 다른 PDF를 가리킬 수 있는 경쟁 상태도 있었다. 모든 페이지의 텍스트 추출을 Promise.all로 동시에 시작해 큰 PDF에서 메모리를 과도하게 사용할 가능성도 지적됐다.
그 밖에 각주나 페이지 번호를 본문으로 잘못 추정하는 문제, 언어를 바꿔도 오류·성공 문구가 이전 언어로 남는 문제, 실제 PDF.js 워커와 대형 PDF를 다루는 종단 간 테스트 부재가 확인됐다.
공개 평판과 실제 결과를 함께 보면
이번 사례는 커뮤니티의 엇갈린 평가와 꽤 잘 맞는다. Ox Alpha는 프로젝트 구조, 타입, 다국어, SEO, 테스트 같은 체크리스트를 넓게 처리했다. 무료 프리뷰 모델로는 인상적인 범위다. 반면 실제 PDF 도메인의 문단 구조, 브라우저 메모리, 경쟁 상태처럼 깊은 반례는 놓쳤다.
따라서 “코딩을 잘한다”는 평가는 맞을 수 있지만, 이를 “리뷰 없이 배포해도 된다”로 바꾸면 안 된다. 사람 개발자로 비유하면 기본기가 좋은 주니어에서 초급 미들 수준이라는 평가는 이 사례에 한해 설득력이 있다. 다만 이는 한 작업, 한 프롬프트, 한 하네스에서 나온 결과다.
어떤 사람에게 적합할까?
추천: 비용을 낮추면서 MVP, 반복 UI, Registry 등록, 기본 테스트 같은 넓은 작업을 만들고 이후 별도 리뷰 모델이나 개발자가 검수할 수 있는 사람.
비추천: 결제, 인증, 개인정보, 대용량 처리, 복잡한 동시성처럼 실패 비용이 큰 기능을 한 번의 생성 결과만 보고 배포하려는 경우.
무료 제공 조건과 공급자 정책은 바뀔 수 있다. 장기 운영에 사용하기 전 가격, 데이터 보존 정책, 가용성을 다시 확인해야 한다.
이번 경험에서 얻은 핵심은 모델 순위보다 작업 흐름이다. 구현 모델과 리뷰 모델을 분리하고, 정상 경로 테스트 다음에 실제 반례를 넣어야 한다. 이번 PDF→Markdown 기능은 문단·페이지 경계 보존, 대형 파일 제어, 파일 교체 경쟁 상태를 수정한 뒤 실제 PDF 종단 간 테스트를 통과해야 운영 배포를 논할 수 있다.
확인한 자료
- free-claude-code 공식 GitHub 저장소 — 확인일: 2026-08-27
- Z.ai GLM-5.3-Flash 공식 발표 — 확인일: 2026-08-27
- OpenRouter Ox Alpha 모델 페이지 — 확인일: 2026-08-27
- TechCrunch의 초기 반응 정리 — 확인일: 2026-08-27
- Reddit Ox Alpha 사용자 경험 — 확인일: 2026-08-27
- Elixir Forum 사용자 경험 — 확인일: 2026-08-27
- LiveCodeBench v6 독립 테스트 — 확인일: 2026-08-27
- GPT-5.6 Sol 코드 리뷰 대화 — 확인일: 2026-08-27
#freeclaudecode #OxAlpha #GLM53Flash #ClaudeCode #AI코딩 #코딩에이전트 #GPT56Sol #코드리뷰 #개발후기 #MVP개발
댓글
댓글 쓰기