이번 주 AI 산업은 에이전트의 '실전 배치'가 전방위로 확산되는 동시에, 그 속도를 걱정하는 내부 경고가 맞부딪힌 한 주였다. 해외에서는 프론티어 랩의 안전 문화를 둘러싼 균열과 소비자용 에이전트의 현실적 한계가 드러났고, 국내에서는 금융·콜센터·인프라 전반에서 생성형 AI가 핵심 업무로 파고드는 흐름이 뚜렷해졌다.
해외 뉴스
오픈AI에서 주요 모델 출시마다 안전 보고서를 작성하던 데이비드 로빈슨이 사직하고 공개 비판에 나섰다. 그는 실리콘밸리가 '극단적 자신감'과 '끝없는 전력질주'로 더 크고 강한 모델을 만들면서 잠재적 위험을 과소평가한다고 지적했다. 특히 프론티어 랩이 원자력발전소나 공항처럼 중복 안전장치와 느리고 신중한 계획을 갖춰야 한다고 주장했다. 최근 앤트로픽과 구글 딥마인드 등에서도 안전 인력의 이탈이 이어지고 있다. 1
오픈AI는 일반 사용자를 겨냥한 에이전트 플랫폼 'Dots'를 최상위 요금제(월 100달러 프로 계정 등)부터 선보였다. Dots는 블렌더, GIMP 같은 앱에 접근하고 데스크톱 챗GPT를 통해 사용자 PC까지 제어할 수 있어 '소비자형'이라기보다 업무용 소프트웨어에 가까운 성격이라는 평가가 나왔다. 오픈AI는 클라우드 컴퓨터와 앱 접근을 바탕으로 Dots가 '거의 무엇이든 할 수 있다'고 설명했다. 2
테크크런치는 백악관이 저커버그, 베이조스, 머스크, 아모데이 등 주요 CEO를 모아 '도덕적 구속력'이 있다는 AI 안전 서약에 서명하게 하고, 트럼프 대통령이 AI를 '초지능'으로 공식 리브랜딩하는 행정명령에 서명했다고 전했다. 그러나 소비자 중 단 2%만이 AI에 지갑을 연다는 현실도 함께 짚으며, AI 수익의 무게중심이 여전히 엔터프라이즈에 있음을 강조했다. 또한 오우라의 IPO 철회, 앤트로픽 S-1 유출, 오픈AI의 사모 복귀 등은 공개시장이 까다로워졌음을 시사한다고 평가했다. 3
오픈AI는 GPT-6 패밀리 활용 가이드를 공개하며 추론 강도 조절, 프롬프트·스킬 개선, 도구 연동, 프로덕션 워크플로 준비 등 실전 적용법을 제시했다. 실제 적용 사례도 함께 나왔다. 채텀파이낸셜은 코덱스와 GPT-5.6으로 거래 검증 시간을 30분에서 4분 미만으로 줄였고, 식료품 유통기업 앨버트슨스는 챗GPT 엔터프라이즈와 API를 활용해 업무 속도를 높이고 있다. 이들 사례는 '챗봇'이 아니라 워크플로 재설계 차원에서 AI를 활용하는 경향을 보여준다. 456
국내 뉴스
영국계 글로벌 금융그룹 바클레이스가 앤트로픽의 클로드를 전사로 확대한다고 밝혔다. 2026년 말까지 개발자의 50%, 2027년에는 소프트웨어 엔지니어 과반이 클로드 코드를 쓰도록 하고, 레거시 시스템 현대화와 사이버보안까지 AI를 내재화한다는 계획이다. 이미 영국 소매금융 직원 1만6천여 명이 RAG 기반 지식 비서를 써 누적 검색 100만 건을 넘겼고, 글로벌 마켓에서는 하루 12만 건의 이메일을 클로드가 분류·보강한다. 7
포지큐브가 중기부 팁스 딥테크 트랙에 선정돼 3년간 '풀 듀플렉스 음성 LLM 기반 차세대 AICC' 개발에 나선다. 기존 콜센터 AI는 듣기와 말하기를 순차 처리하는 '하프 듀플렉스' 방식이라 AI 발화 중 고객 질문을 인식하지 못해 응답이 지연되는 한계가 있었다. 포지큐브는 듣기와 말하기를 동시에 처리해 답변 도중 질문에 즉시 반응하고 상담 중 예약 변경·문자 발송 같은 업무까지 처리하는 것을 목표로 한다. 목표 성능은 음성인식 오류율 6% 이하, 응답 지연 700ms 이하이며, 경동나비엔에서는 상담 처리시간 30% 이상 단축, 첫 통화 해결률 25% 이상 향상 실적을 보유했다. 8
Arm은 에이전틱 AI 시대의 인프라가 '실행'을 넘어 '통제·보안'으로 확장되고 있다고 강조했다. 고성능 Arm CPU가 에이전트 런타임과 도구 실행을 담당하고, Arm 기반 DPU와 인프라 프로세서는 호스트 CPU와 분리된 영역에서 감시·격리·정책 시행을 수행하는 역할 분리 구조를 제시했다. 엔비디아의 '오픈 에이전트 세이프티 플랫폼'은 블루필드-4와 오픈셸·센트리 통합으로 독립적 보호 계층을 구현한 사례로 소개됐다. 9
챗GPT와 클로드 사용이 일상화되면서 사람의 언어 습관까지 변하고 있다는 분석이 나왔다. 간결하고 단정적인 화법, 과한 칭찬과 긍정, '목표가 무엇인가요' 같은 지시형 질문이 회의와 이메일에 스며들어 'LLM 말투', '클로드 말투'라는 표현까지 생겼다. 반대로 이를 경계하는 움직임도 있어, 한 스타트업은 AI식 표현을 많이 쓴 직원에게 회식비를 부담하게 하는 제도까지 도입했다. 전문가들은 이러한 화법 상당수가 원래 전문직에서 쓰이던 것이 AI를 통해 널리 퍼진 결과라고 지적하며, 언어의 개성이 희미해질 수 있다는 우려도 제기된다. 10
커뮤니티 화제
대만 AI 기업 애피어가 작은 모델이 스스로 도구(API)를 만들어 쓰게 하는 'SMITH' 기술을 공개해 뉴립스에 채택됐다. 지금까지 에이전트는 사람이 미리 만든 API에 의존하거나, 도구를 만드는 모델과 쓰는 모델이 달라 피드백을 받기 어려웠다. SMITH는 한 모델이 도구를 만들고 직접 써 보며 고치는 과정을 반복해 실력을 키우고, 검증을 통과한 도구만 공유 라이브러리에 담는다. 40억 파라미터 소형 모델이 학습하지 않은 과제에서 300억 모델이 즉석에서 도구를 만든 경우보다 높은 점수를 냈고, 문제 해결에 쓰는 토큰이 평균 3206개에서 약 100개로 줄어 효율이 약 32배 개선됐다. 값비싼 대형 모델 없이 에이전트를 운영하려는 기업의 비용 부담을 덜어줄지 관심이 쏠린다. 11
머신러닝 커뮤니티에서는 LLM의 '권위 편향(Authority Bias)'을 다룬 연구가 소개됐다. 저자들은 사용자가 틀린 답을 고집해도 소신을 지키던 모델이, 똑같은 틀린 주장이 '검증된 출처'에서 왔다고 하면 답을 바꾸는 현상을 관찰했다. 기존 아첨(sycophancy) 평가는 사용자의 압박에 초점을 맞췄다면, 이 연구는 '출처의 권위'라는 취약점을 조명하며 도구·검색 결과 등 외부 출처로부터의 오정보에 대한 대비의 중요성을 강조했다. 12
레딧에서는 제미나이 4 아르곤의 '100만 토큰 출력' 역량을 두고 과장이냐 도약이냐를 놓고 토론이 벌어졌다. 작성자는 오푸스 5.5나 아스트라가 12만~30만 토큰(약 90~180쪽)에서 출력을 제한하는 반면, 아르곤은 100만 토큰(약 1400쪽)에 달한다고 소개하며 이를 '도약'으로 평가했다. 긴 작업에서 발생하는 '컨텍스트 드리프트', 작업 분할, 반복되는 '계속하기' 프롬프트 문제를 줄일 수 있다는 점을 핵심 논거로 제시하며, 벤치마크 점수보다 '한 번에 길고 일관되게 처리하는 능력'을 더 중시해야 한다고 주장했다. 13