안녕하세요! 이번 주에는 모델 선택 가이드, 평가 도구, 그리고 에이전트 실무 적용 사례가 특히 눈에 띄었습니다. 오픈소스 쪽에서는 개발자 생산성을 바로 높일 수 있는 도구와 워크플로가 계속 쌓이고 있네요.
실무에 바로 쓰는 GPT-6 가이드와 생산성 사례
OpenAI는 스타트업이 GPT-6 계열을 고를 때 무엇을 기준으로 봐야 하는지, reasoning effort를 어떻게 조절할지, 프롬프트와 도구 호출을 어떻게 묶어야 하는지 정리한 가이드를 공개했습니다. 프로덕션 워크플로를 염두에 둔 선택 기준이어서, “어떤 모델을 어디에 붙일지” 고민하는 팀에 특히 유용해 보입니다. 원문
같은 맥락에서 Chatham Financial 사례는 Codex와 GPT-5.6으로 업무 흐름 자체를 다시 짜서, 트레이드 검증 시간을 30분에서 4분 미만으로 줄였다고 소개합니다. 단순 자동화가 아니라 검증·승인·조사 같은 반복 업무를 재설계한 점이 인상적입니다. 원문
또 다른 사례로 Albertsons는 ChatGPT Enterprise와 API를 활용해 내부 팀의 작업 속도와 고객 경험을 함께 개선하고 있다고 밝힙니다. 현업용 생성형 AI 도입이 이제는 “데모”보다 “업무 공정 개편” 단계로 이동하고 있음을 보여줍니다. 원문
DeepMind의 새 프론티어 모델과 생물학 워터마킹
Google DeepMind는 Gemini 4 Argon을 차세대 프론티어 지능으로 소개했습니다. 세부 성능은 이번 목록에 없지만, 업계가 다시 한 번 초거대 모델 경쟁 국면에 들어섰다는 신호로 읽힙니다. 원문
더 흥미로운 건 SynthID Bio입니다. AI가 생성한 단백질에 워터마크를 넣되 생물학적 기능은 유지하는 개념증명이라고 설명합니다. 텍스트·이미지를 넘어 생명과학 생성물의 출처 추적까지 확장하려는 시도라서, 바이오 AI를 다루는 개발자라면 체크할 만합니다. 원문
평가와 검증: 이제는 모델보다 워크플로가 중요
Hamel Husain은 Anthropic의 Claude 자동 eval 도구를 써본 뒤, “데이터를 먼저 보고” 평가를 설계해야 한다는 점을 강하게 짚습니다. 그는 이 도구가 초반엔 너무 빨리 평가 항목을 정하고, 판단 근거를 볼 맥락이 부족했다고 소개하면서도, 문제 탐지 능력 자체는 꽤 강력했다고 평가합니다. 요약하면, 자동 eval은 유용하지만 검토 인터페이스와 데이터 탐색이 먼저라는 메시지입니다. 원문
Hugging Face 쪽에서도 비슷한 흐름이 보입니다. MCP 에이전트의 사실 여부만이 아니라 “출처를 제대로 맞췄는가”를 검증하는 접근을 다뤘고, enterprise agent용 합성 학습 데이터 생성, 멀티링구얼 TTS/보이스 클로닝 평가, 탭ুল러 예측 모델 같은 실무형 주제가 이어졌습니다. 결국 이번 주의 키워드는 성능 경쟁보다 “검증 가능한 AI”입니다. 원문 / 원문 / 원문 / 원문
Svelte와 Vercel: AI 개발 스택도 계속 진화
SvelteKit 3가 정식 출시됐고, sv 마이그레이션 도구로 업그레이드를 최대한 자동화해 준다고 합니다. 설정 위치가 바뀌고, alias와 환경변수 처리도 정리되는 등 프레임워크 정비가 꽤 크지만, 기존 사용자 입장에서는 비교적 부드럽게 넘어가도록 설계한 점이 눈에 띕니다. 원문
Vercel은 JavaScript가 아닌 Python 엔지니어를 위한 Jev 소개 글과, 에이전트가 작성한 코드를 5분 만에 프로덕션에 올리는 Rogo 사례를 함께 다뤘습니다. 특히 AI 코드를 실서비스로 보내는 속도를 강조한 점이 요즘 배포·검증·관측성 스택의 관심사를 잘 보여줍니다. 원문 / 원문
GitHub 급상승 레포 랭킹
- KKKKhazix/AIHOT — ⭐5304
- Louis-CFM/coucou — ⭐3153
- feder-cr/dots — ⭐2571
- rehan-remade/universal-modder — ⭐2475
- CopilotKit/OpenDots — ⭐2088
- yihui-dev/awesome-opus5-5-videos — ⭐1521
- wy51ai/floorplan-3d — ⭐1360
- firelex/jeff — ⭐1342
- nanaism/yomiyasu — ⭐1284
- edenfunf/reelmimic — ⭐1035
- echris6/motion-video-kit — ⭐974
- CAPCOM-TD-OSS/REDox — ⭐959
- facebookincubator/muse-gadget-sdk — ⭐718
- openai/mcp-extensions — ⭐716
- chasmlol/SkyCraft — ⭐688
상위 5개를 보면 이번 주 GitHub의 분위기가 꽤 선명합니다. AIHOT는 신호 수집과 일간 리포트 자동화 프레임워크처럼 보이고, coucou는 화면 상단에서 에이전트 활동을 감시하는 작은 상시 도우미입니다. dots는 브라우저를 내장한 웹용 AI 에이전트, universal-modder는 게임 모딩을 에이전트로 자동화하는 도구, OpenDots는 텍스트·통화·Slack을 오가는 “항상 켜진 동료”를 지향합니다. 즉, 에이전트가 단순 채팅을 넘어 감시·실행·개입까지 담당하는 방향이 강합니다.
주목할 개발자 후보
KKKKhazix
대표 레포를 보면 최근 이 개발자는 AI Skills와 글쓰기 보조, 그리고 자동 리포팅에 집중하는 흐름입니다. AIHOT은 자체적으로 이슈를 찾고 데일리 리포트를 쓰는 사이트 프레임워크이고, human-writing은 AI 문장을 더 “사람 말투”로 다듬는 스킬입니다. khazix-skills 컬렉션까지 보면, 에이전트가 목표 설정·편집·분석을 수행하도록 만드는 작업을 꾸준히 확장하는 중으로 보입니다.
Louis-CFM
coucou가 핵심입니다. 여러 코딩 에이전트(Claude Code, Codex, Cursor, Gemini CLI 등)를 화면 위에서 상시 감시하는 유틸리티라서, 이 개발자는 에이전트 운영 가시화와 안전장치 쪽에 관심이 큰 것으로 읽힙니다. 다른 레포가 적어도, 최근 작업의 중심은 “에이전트를 사람 옆에서 관리하는 도구”에 있는 듯합니다.
feder-cr
dots가 대표작입니다. 브라우저를 갖춘 웹 AI 에이전트라는 설명과, 같이 보이는 awesome-dots/시스템원 관련 레포들을 보면, 이 개발자는 막히지 않는 브라우저 자동화와 의사결정 에이전트 스택을 함께 실험하고 있는 것으로 보입니다. 즉, 단순한 봇보다 현실적인 웹 작업을 끝까지 수행하는 에이전트에 집중하는 흐름입니다.
Hugging Face 인기 모델
- convaiinnovations/laya — 좋아요 5049
- Cloudflare/clef — 좋아요 934
- abenzerps/Qwen-Image-2.1-Uncensored-GGUF — 좋아요 2905
- Contrastive-LM/CLM-v0.1-8B — 좋아요 688
- Lightricks/LTX-2.5 — 좋아요 6081
- SupersonicLabs/Julia-1 — 좋아요 390
- Qwen/Qwen-Image-2.1 — 좋아요 2882
- Qwen/Qwen3.8-27B — 좋아요 16855
- Cloudflare/clef-flash — 좋아요 335
- PSRben/VisionHOPE — 좋아요 388
눈에 띄는 건 Qwen/Qwen3.8-27B와 Lightricks/LTX-2.5입니다. 전자는 높은 인기도를 바탕으로 범용 멀티모달 계열의 존재감을 보여주고, 후자는 이미지-비디오 생성 쪽에서 강한 관심을 받고 있습니다. Cloudflare의 clef 계열은 image-text-to-text 범주에서 가볍고 실용적인 도구 성격이 강해 보입니다.
OpenRouter 급상승 모델
전주 대비 사용량 증가율 기준으로 보면:
- stealth/space-bunny-alpha — 437%
- openai/gpt-6-luna-pro-20260922 — 359%
- openai/gpt-6-luna-20260922 — 261%
- anthropic/claude-opus-5.5-20260921 — 228%
- xiaomi/mimo-v2.6-flash-20260921 — 201%
- inclusionai/ling-3.0-flash-sante-20260904:free — 200%
- openai/gpt-6-sol-20260922 — 137%
- x-ai/grok-4.7-20260916 — 70%
- xiaomi/mimo-v2.6-pro-20260921 — 55%
- nvidia/nemotron-3-super-120b-a12b-20230311:free — 39%
이번 주는 GPT-6 계열과 Claude Opus, 그리고 몇몇 플래시/프리 모델의 사용량이 크게 늘었습니다. 실제 현장에서는 성능만큼이나 가격·속도·접근성이 모델 선택을 좌우하고 있다는 뜻으로 읽힙니다.
이번 주도 결국 핵심은 명확했습니다. 더 똑똑한 모델보다, 더 잘 검증되고 더 잘 배포되는 AI가 개발자에게 먼저 도움이 됩니다.