{}
TypeSafe AI가 자동화용 System One Model ‘Jev’를 얼리 액세스로 공개함 대화형 텍스트 생성보다 코드 내부의 분류·라우팅·점수화·추출·분기 같은 단순 판단 작업에 초점 자유 형식 문자열 대신 미리 정의된 타입의 구조화된 값을 반환 Jev는 기존 LLM과 다른 실행 모델을 사용함 토큰을 자기회귀적으로 생성하지 않고 가능한 출력을 병렬로 계산 구조화된 프로그램 상태를 입력으로 받고 타입이 지정된 확률적 결정을 출력 각 결과에 확률과
현재의 프런티어 LLM은 지식 노동자를 완전히 대체할 만큼 자율적이지 않음 프런티어 연구소의 기업가치는 완전 자동화 기술을 만들 것이라는 기대에 크게 의존하지만, 현행 모델은 단순한 작업에도 세심한 감독과 안전장치가 필요함 나비에-스토크스, FreeBSD RCE, Hugging Face 사건 같은 성과만 보면 상당한 자율성을 확보한 듯함 하지만 소프트웨어 기업들은 벤치마크 점수가 모델보다 낮은 엔지니어도 계속 고용해 모델을 감독하게 함 모델은 훈련받은
디테일과 편집 정확도 개선, 2.0 대비 생성 대기 시간 최대 50% 단축 참고 사진 속 인물·피사체의 특징을 더 잘 유지하고, 조명과 질감도 자연스러워짐 요청한 부분만 수정하는 능력 강화 반복 편집에서도 기존 수정 사항과 이미지 품질을 더 안정적으로 유지 복잡한 구도·투명 배경·스타일 지시 반영과 이미지 속 정보 정확도 개선 @Sketch 추가. 직접 그린 스케치로 이미지 생성 가능. 이미지 위에 댓글을 달아 수정할 부분 지정 가능 스케치
에이전트형 개발과 경쟁 코딩 성능에 맞춰 학습·최적화함 긴 작업에서도 문맥과 이전 결과를 추적하고, 불완전하거나 충돌하는 입력을 처리하며, 필요할 때 사용자에게 추가 정보를 요청함 불필요한 작업 단계를 줄이고 출력을 정돈해 첫 시도 정확도와 도구 호출의 신뢰성을 높였으며, 여러 코딩 평가에서 frontier 모델과 경쟁할 만한 성능을 보임 어려운 추론과 에이전트형 작업에는 max reasoning을 지원해 실제 사용성을 개선함 영상·이미지·문서를 네이
Gemini 3.8을 3.7 Flash와 같은 속도·비용으로 출시함 3.7 Flash 공개 3주 만이자 6주 동안 세 번째 Flash 릴리스로, 소프트웨어 엔지니어링·에이전트 작업·전문 분야의 핵심 다단계 추론 성능을 크게 높였음 두 가지 변형을 제공함 Gemini 3.8 Flash: 범용 주력 모델로, 3.7 Flash와 같은 도입 가격인 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75임 Gemini 3.8 Flash Cyb
Qwen3.8-Max-0902로 업그레이드 2.4T 매개변수와 1M 컨텍스트 토큰을 갖춰 현실 세계의 복잡성을 처리하도록 설계함 Coding & Cowork 후속 학습을 추가해 복잡한 엔터프라이즈 업무, 과학 연구, 장기 워크플로 전반에서 성능이 향상됨 1M 토큰당 가격 Input: $2.0 Output: $6.0 캐시 가격 explicit cache hit: $0.17 implicit cache hit: $0.25 QwenCloud API에
Claude Fable 5.1과 Claude Mythos 5.1 출시 코딩과 지식 작업을 위한 최첨단 모델 Claude Fable 5.1은 복잡하고 장시간 실행되는 작업에 강하며, 연구 역량을 통해 AI 모델이 과학 발전에 기여할 가능성을 보여줌 제공 범위는 모델별로 다름 Claude Fable 5.1은 오늘부터 모든 환경에서 이용 가능 사이버 방어 전문가와 생명과학자를 위한 Claude Mythos 5.1은 신뢰 기반 액세스 프로그램을 통해 제공됨
현재: 기존 표준 한도보다 50% 임시 증량 9월 14일부터: 기존 표준 한도보다 25% 영구 증량 따라서 현재와 비교하면 사용 가능량이 줄어듦 예를 들어 기존 한도가 100이라면 현재 150 → 9월 14일부터 125가 됨 원래 한도보다는 25% 많아지지만 현재 임시 한도보다는 약 16.7% 감소임
GLM-5.2와 같은 베이스 모델에 사후 학습만 적용해 복잡한 코딩과 장기 작업 성능을 높임 자체 Z.ai Code Bench에서 GLM-5.2보다 50% 향상됐으며, 코딩용 오픈 웨이트 모델 가운데 가장 강력한 성능을 보임 Terminal Bench 3.0과 Agents' Last Exam 등 공개 벤치마크에서도 오픈소스 SOTA를 달성함 사후 학습 규모를 키우는 과정에서 예상보다 빠르게 사이버 역량이 발달함 취약점 발견을 측정하는 Cyber
GLM-5 시리즈 최초의 네이티브 멀티모달 모델을 공개함 총 320B 파라미터 중 18B만 활성화하면서 벤치마크와 실제 워크로드에서 GLM-5.2를 앞섰고, 가격은 10분의 1 수준이며 코딩·에이전트 벤치마크에서는 Claude Opus 4.8에 근접함 sparse attention과 linear attention을 결합한 첫 하이브리드 구조로 정확한 long-context 역량을 유지하면서 서빙 비용을 크게 낮췄고, Manifold-Constraine
뉴스1
진화하는 北 IT인력 美위장취업…"AI로 석달간 1000곳 지원"
WSJ "AI기술·명의도용으로 美기업 원격근무…자금 90% 정권 유입" 연 1조 원 외화벌이…美 조력자 도움으로 회사 출근 등 대면 업무 수행 북한의 정보기술(IT) 노동자들이 미국 기업의 원격 근무 일자리에 위장 취업한 뒤 연간 수억 달러를 벌어들이며 정권에 송금하고 있다고 13일(현
결론부터: 시댄스 2.5는 "한 번에 30초, 최대 180초까지 장편을 생성할 수 있는" 클라우드 영상 생성 모델입니다. 바이트댄스가 2026년 7월 31일에 공개했고, 프롬프트에 시간을 찍으면 그 시점에 그 동작을 수행하는 타임스탬프 제어가 가장 체감이 큽니다. 시댄스 2.5에서 직접 써볼 수 있습니다. 다만 오픈웨이트가 아니라 클라우드 크레딧제라, "로컬 설치 + 무료 실행"은 없습니다. 장편이 목적이면 시댄스
전 세계 에이전트 하네스 개발자를 대상으로 소스 코드가 포함된 개발자 프리뷰를 공개함 GitHub에서 소스 코드 보기와 개발자 문서를 통해 바로 확인 가능 GitHub의 프로젝트 페이지와 빠른 시작 문서도 제공됨 $ npx @deepseek-ai/dsh web$ git clone https://github.com/deepseek-ai/deepseek-harness에이전트의 모든 기능을 교체·재조합할 수 있는 플러그인으로 구성함 모델이 에이전트의
2026년 8월 13일, 코딩과 에이전트용 주력 모델을 출시함 널리 사용되는 Flash 시리즈를 확장한 모델로, Gemini 3.6 Flash 출시 3주 만에 개발자 피드백과 알고리즘 혁신을 반영해 선보임 소프트웨어 엔지니어링·지식 업무·웹 개발 워크플로 전반을 크게 개선했으며, 토큰 100만 개당 도입 가격은 기존 3.6 Flash 가격의 절반으로 책정됨 복잡한 워크플로의 지능 향상디버깅과 문제 해결에서 더 정확하고 실전적인 코드를 생성함 첫 시도
Qwen3.8-Max는 Qwen3.8-2.4T-A95B를 기반으로 비전 입력, 비사고 모드 지원, 기본 1M 컨텍스트 길이, 공식 내장 도구 등의 기능을 추가한 공식 버전. 자세한 내용은 Qwen3.8-Max 개요에서 확인 가능 Qwen3.8은 Qwen 오픈 모델 계열 최초로 Qwen-Max급 모델을 공개하며, 지금까지 이 계열에서 가장 강력한 세대로 출시됨 Qwen3.5와 Qwen3.6이 커뮤니티에서 널리 채택된 데 이어, Qwen3.5의 아키텍처를
2026년 8월 12일, 장시간 실행 에이전트와 고난도 인터랙티브·시각 작업에 초점을 맞춘 Grok 4.6을 출시함 Grok 4.5를 기반으로 연구, 정보 분석, 코드베이스 전반의 작업, 아이디어를 완성도 높은 애플리케이션이나 업무 결과물로 구현하는 복잡한 다단계 작업을 더 오래 이어갈 수 있음 Cursor와 Grok Build에서 바로 이용 가능하며, API와 OpenRouter·Vercel·Cloudflare 같은 파트너에서도 제공됨 첫 주에는 G
듀크대학교를 중심으로 한 산학 공동 연구가 AI 채용 도구를 속이려는 ‘프롬프트 인젝션’ 실태를 처음으로 대규모로 분석한 결과를 공개했다. 연구팀은 인기 채용 플랫폼 hireEZ에 제출된 실제 이력서 20만 건을 분석한 결과, 최소 1%에서 AI 시스템을 조작하려는 숨겨진 지시문이 포함된 것으로 나타났다. 이 연구는 실제 현장에서 널리 쓰이는 AI 애플리케이션을 대상으로 한 최초의 체계적 조사로, 오는 8월 USENIX Security Symposiu
코딩 에이전트에게 가장 좋은 프로그래밍 언어는? 흔히 동적 타입 언어는 코드가 짧아서 LLM 토큰도 적게 사용한다는 주장이 있음 기존 소규모 벤치마크에서는 언어에 따라 생성 코드의 토큰 수가 2배 이상 차이 나는 경우도 있었음 C와 Clojure 사이에서 약 2.6배 차이가 관찰되기도 함 J, Clojure처럼 표현력이 높은 언어가 특히 유리하게 나타남 이를 근거로 Ruby, Clojure, J 같은 간결한 언어가 AI 코딩에 더 적합하다는 주장도 나
xAI가 Grok Bot을 Early Beta로 공개 단순히 질문에 답하는 AI Assistant가 아니라, 자체 컴퓨터를 가지고 실제 앱과 웹사이트에서 업무를 수행하는 AI teammate를 지향 사용자의 도구에 로그인하고, 사람이 사용하는 것과 같은 방식으로 작업한 뒤 완료된 결과물을 가져오는 구조 프로젝트를 처음부터 끝까지 맡길 수 있음 데스크톱이나 iOS에서 동료에게 메시지 보내듯 Bot에게 업무를 전달 작업 방식과 프로젝트 컨텍스트를 유지하며
h3-metal은 Apple Silicon에서 MiniMax-H3를 네이티브로 추론해 영상과 오디오를 생성하는 도구임 prompt-to-video/audio, first/last-frame conditioning, 순서가 보존되는 Ref2VA 이미지·영상·오디오 참조가 end-to-end로 동작하며, 현재 M3 Max·M5 Max용 Metal 성능과 메모리를 점진적으로 최적화하는 중 모델 확인과 대화형 생성 지원 Hugging Face snapshot