이번 주 연구들은 모델을 실제 시스템에 배치할 때 드러나는 안전, 지연, 정밀도, 행동 제어의 문제를 다룬다. 검색 증강이 안전에 미치는 영향을 분해하는 벤치마크부터, 플랫폼 정책을 모델 가중치에 내재화하려는 산업용 위험 통제 모델, 실제 셸에서 검증기를 실행하며 학습하는 터미널 에이전트, 그리고 시각·언어 모델을 로봇 제어에 연결하는 인터페이스까지, 배치 환경의 제약이 연구의 핵심 조건으로 제시된다.
검색을 붙였더니 더 위험해졌다: RAG 안전 저하의 원인 분해
쉽게 말하면: 믿을 만한 문서를 참고하게 하면 챗봇이 더 정확하고 안전해질 것 같지만, 위험하거나 유해한 질문에서는 검색 증강 생성(RAG)이 생성 응답의 안전에 의도치 않은 부작용을 낳을 수 있다. 이 연구는 그 원인을 더 명확히 보기 위해 검색 조건을 나누어 평가한다. 1
출발점은 검색 증강 생성(RAG)이 환각을 줄이고 답변 품질을 높일 수 있지만, 유해하거나 위험한 콘텐츠를 묻는 상황에서는 전체 응답 안전성을 떨어뜨릴 수 있다는 최근 관찰이다. 문제는 RAG 시스템에서 검색 품질의 영향과 생성 모델 자체의 안전성을 구분하기 어렵다는 데 있다. 저자들은 검색기 품질이라는 교란 요인을 걷어내기 위해 문제를 네 가지 조건으로 분리한다. 검색을 쓰지 않는 경우, 유해 요청의 답이 담긴 오라클 문서를 주는 경우, 유해 요청과 관련은 있지만 구체적 답은 없는 문서를 주는 경우, 그리고 무작위의 안전한 문서를 주는 경우다. 1
이 틀로 다섯 개의 오픈소스 LLM을 평가한 결과, 저자들은 몇 가지 핵심 관찰을 보고한다. 첫째, 양성 과제 능력과 unsafe capability 사이에 역관계가 나타난다. 둘째, 기본 안전 가드레일이 RAG 환경의 하류 안전을 보장하지 못한다는 강한 증거를 제시한다. 셋째, 안전한 문서조차 검색 활성화 시스템에서 unsafe generation으로 이어질 수 있다는 선행 연구의 결과가 일부 모델에서 다시 관찰됐다. 1
실무적 함의는 기업이 내부 문서나 지식베이스를 LLM에 붙일 때, 기반 모델의 안전성을 그대로 하류 RAG 시스템의 안전 보장으로 간주해서는 안 된다는 점이다. RAG-Safety-Bench는 검색 조건별로 안전 영향을 분리해 측정하려는 벤치마크로 제안된다. 1
정책을 프롬프트가 아니라 가중치에 새기다: 초저지연 위험 통제 모델 SIRF
쉽게 말하면: 플랫폼의 복잡한 심사 규정을 매번 긴 입력으로 처리하는 대신, 정책 명세를 모델 가중치에 내재화해 초 단위 지연과 높은 정밀도 조건에서 판정하게 만든 연구다. 선량한 사용자를 잘못 제재하는 거짓 양성을 줄이면서도 안전 위험을 남기는 거짓 음성을 관리하는 것이 중요한 배경이다. 2
산업 현장의 콘텐츠 위험 통제에서 진짜 제약은 평균 정확도가 아니라 높은 정밀도와 초 단위 지연 아래 얼마만큼의 위험을 자동으로 처리할 수 있는가다. 거짓 양성은 무고한 사용자를 제재해 경험과 활동을 직접 줄이고, 거짓 음성은 안전 위협을 남긴다. SIRF는 플랫폼의 복잡한 정책을 EntiGraph, MAGA rewriting, account-level chain-of-thought(CoT)로 추가 사람 주석 없이 합성하고, continued pretraining(CPT)을 통해 모델 가중치에 내재화한다. 이를 통해 verdict-only 배치에서 규칙을 높은 정밀도와 매우 낮은 지연으로 적용하는 것을 목표로 한다. 2
핵심 성과는 통제된 동일 출처 비교에서 나온다. 정책 주입과 판정만 내놓는 출력 형태를 똑같이 맞추고 오직 policy-grounded CPT 유무만 다르게 한 Qwen3-8B-SFT와 SIRF-8B-SFT를 비교했을 때, SIRF-8B-SFT는 Black Recall@P95 71.3을 기록했다. 이는 70M개의 CPT 토큰만으로 일반 능력을 해치지 않으면서 얻은 결과이며, 같은 인터페이스에서 로그 확률을 쓸 수 있는 비교 모델들 사이에서는 훨씬 큰 시스템과 대등하거나 이를 앞선다고 보고됐다. 실제 배치에서는 tree-model adjudication layer로 투입돼 잘못 제재된 표본을 더 많이 복구했고, freezing scenario로의 전이에서도 낮은 비용으로 상대적 오제재를 70% 줄였다. 2
함의는 정책을 어디에 둘 것인가라는 배치 설계 질문에 대한 대안 제시다. SIRF는 복잡한 정책 명세를 모델 가중치에 내재화하면 높은 정밀도와 초 단위 지연이라는 산업 배치 조건에서 위험 자동 처리를 개선할 수 있다고 주장한다. 2
누가 무엇을 주장하는가: 논쟁의 주장과 개체를 한 번에 태깅하기
쉽게 말하면: 정치 토론에서 주장이나 전제를 표시하는 것만으로는 부족하고, 그 주장이 어떤 인물·사건·장소·정당 같은 개체를 언급하는지도 함께 알아야 해석이 쉬워진다. 이 연구는 논증과 토론 개체를 함께 태깅하는 방식을 제안한다. 3
기존 논증 마이닝(AM)은 주장·전제 같은 논증 성분과 역할을 표시하지만, 그 논증을 정치적으로 해석하는 데 중요한 개체(인물·사건·장소·정당)를 짝지어진 층으로 제공하지 않는 경우가 많다. 저자들은 두 가지로 이 공백을 메운다. 첫째, USElecDeb 데이터셋에 논증 구간과 비논증 구간 모두에 걸쳐 토론 개체(DNE) 층을 더한 DNE-ElecDeb를 구축하고, 이를 탐지하는 과제를 토론 개체명 인식(DNER)으로 정의했다. 둘째, JAET(Joint Argument and Entity Tagging)라는 생성형 틀을 제안한다. 디코더 전용 LLM을 미세조정해 원본 발화를 보존하면서 논증 태그와 개체 태그를 토론 발화 안에 인라인으로 삽입하게 한다. 3
BIO 태깅 평가에서 JAET는 결합 과제(AM+DNER)에서 동일 백본 위에 세운 가장 강한 순차 AM-DNER 파이프라인 대비 유형 미구분 설정에서 +27.3%, 유형 구분 설정에서 +41.9% 상대 향상을 보였다. 이는 두 독립 모듈을 조합하는 방식으로는 같은 이득을 회복하기 어렵다는 점을 보여준다. 또한 정치 토론과 다른 영역인 Persuasive Essays에서도 각각 +26.6%, +52.7%의 비슷한 폭이 재현돼, 정치 토론과 성격이 다른 도메인으로의 일반화 가능성을 제시했다. 3
함의는 서로 얽힌 두 층위, 즉 논증과 개체를 하나의 관점으로 통합할 때 정치 토론 이해를 더 풍부하게 만들 수 있다는 점이다. 저자들은 이 통합 표현이 정치 토론 이해를 위한 기여라고 설명한다. 3
보는 눈과 그리는 손을 하나로: 인코더도 VAE도 없는 통합 시각 지능 SenseNova-U1.5
쉽게 말하면: 이미지를 이해하고 추론하고 생성하는 능력을 하나의 네이티브 통합 멀티모달 모델 안에서 처리하려는 연구다. SenseNova-U1.5는 인코더와 VAE 없이 시각 콘텐츠를 이해·추론·생성하는 구조를 내세운다. 4
SenseNova-U1.5는 8B-MoT 규모의 네이티브 통합 멀티모달 모델로, encoder-free와 VAE-free 아키텍처를 사용한다고 설명된다. 저자들은 spatially coherent patch reconstruction으로 시각 인터페이스를 강화하고, 엄선한 생성·편집 데이터, 개선된 과제 형식화, 구조적 프롬프트 강화, 최대 4K의 네이티브 해상도로 학습을 확장했다. 후처리 단계에서는 시각 미학, 이중언어 텍스트 렌더링, 인포그래픽 생성, 이미지 편집을 위한 전문화된 전문가를 최적화하고, multi-expert on-policy distillation으로 그 능력을 통합했다. 4
저자들은 광범위한 평가에서 이미지 충실도, 텍스트 렌더링, 복잡한 구성, 다중 참조 편집, interleaved generation이 크게 향상되는 동시에 지시 따르기가 개선되고 주체 정체성·기하·미수정 영역이 보존됐다고 보고한다. 특히 생성 데이터에서 구조화된 형식에 대한 노출이 제한적이었음에도, 길고 복잡하며 구조화된 시각 지시로 효과적으로 일반화됐다는 점을 강조한다. 이는 멀티모달 이해가 시각적 계획과 창작으로 전이될 수 있음을 보여주는 근거로 제시된다. 4
저자들은 지도 미세조정, 강화학습, 온폴리시 증류를 포함한 학습 코드를 공개하겠다고 밝혔다. 함의는 이해와 생성을 완전히 분리된 경로로 두기보다, 지각·추론·창작을 end-to-end 통합 프레임워크에서 다루는 native unified modelling이 유망한 방향이라는 것이다. 4
실행 결과로 배우는 터미널 에이전트: 300턴을 버티는 강화학습 T1
쉽게 말하면: 말로만 답을 내는 모델이 아니라 실제 클라우드 샌드박스의 셸을 조작하고, 각 과제의 검증기를 실행한 결과로 보상을 받으며 학습한 터미널 에이전트다. 긴 지평의 코딩·과학 발견 같은 과제를 겨냥한다. 5
에이전트 활용이 코딩·과학 발견 같은 장기 지평 과제로 옮겨가면서, 터미널 과제는 중요한 시험대가 됐다. T1은 총 122B 규모의 Mixture-of-Experts 모델로, 강화학습을 통해 학습되며 클라우드 샌드박스에서 실제 셸을 과제당 최대 300회 이상의 tool-call turn 동안 조작한다. 보상은 각 과제 고유의 verifier를 실행해 얻는다. 저자들은 안정적인 actor-critic 학습을 위해 dense process reward를 사용해 궤적을 통과한 verifier의 절대 개수로 점수화하고, TITO construction으로 샘플링된 정확한 토큰 식별자에 대해 학습하며 턴 경계에서 drift repair를 수행한다. 또한 rollout routing replay를 통해 각 MoE 층에서 샘플러의 토큰별 전문가 선택을 기록하고 학습 때 재생한다. 5
성과는 수치로 제시된다. TITO와 R3는 학습-추론 로그 확률 차이를 0.021에서 0.013으로 줄였고, 손실 영역에서 토큰 드리프트를 정확히 0으로 맞췄다. Terminal-Bench 2.1에서 post-train pipeline은 초기 base model의 43.8%를 T1의 64.0% resolved로 끌어올렸다. Long-Horizon Terminal Bench에서는 T1이 27.9%에 도달해 GPT-5.4와 GLM-5.1을 넘어섰다고 보고됐다. 5
저자들은 학습 코퍼스가 Terminal-Bench 2.1과 분리된 격리 시드와 합성 과제로 구성돼, 성능 향상이 벤치마크 과적합이 아니라 능력 전이를 반영한다고 주장한다. 함의는 실제 셸 실행과 과제 검증기에서 나온 보상을 이용해 장기 지평 터미널 에이전트를 강화학습으로 개선할 수 있음을 보였다는 점이다. 5
VLM에게 로봇을 '플레이'하게 하다: 의미 단위 인터페이스 Show-Harness
쉽게 말하면: 세상을 잘 아는 시각·언어 모델(VLM)의 지식을 로봇 제어로 옮기기 위해, 의도와 행동을 잇는 간결한 의미 인터페이스를 만든 연구다. 모델이 자연스럽게 추론할 수 있는 이산적 의미 행동 단위를 로봇의 국소 행동으로 접지한다. 6
기반 시각-언어 모델(VLM)은 물체와 공간 관계 인식, 장기 목표 분해 등 로봇 조작에 필요한 지식을 이미 많이 갖고 있지만, 그 지식이 로봇 행동으로 잘 옮겨지지 않는다. 기존 시각-언어-행동(VLA) 모델은 VLM을 저수준 제어로 끌어와 구현체별 연속 행동을 회귀하도록 미세조정하는데, 이는 넓은 의미 지식을 불투명한 픽셀-행동 매핑으로 압축한다. Show-Harness는 VLM이 자연스럽게 추론할 수 있는 이산적 의미 행동 단위를 노출하고, 구현체별 해석기가 이를 결정론적으로 로컬 로봇 행동으로 접지한다. 이 구조는 VLM이 세밀한 물리적 결정에 직접 책임을 지도록 설계됐다. 6
이 인터페이스는 두 가지 제어 방식을 연다. 첫째, 폐쇄형 프론티어 VLM을 제로샷 로봇 제어에 직접 활용할 가능성을 보인다. 둘째, 소형 오픈소스 VLM을 같은 인터페이스에서 몇 GPU-시간의 미세조정만으로 저비용 배치에 적응시킬 수 있음을 보인다. 저자들은 광범위한 실험에서 Show-Harness를 갖춘 VLM 에이전트가 과제·구현체·환경에 걸쳐 견고하게 일반화하며 대표적 에이전트 및 VLA 패러다임을 앞선다고 보고한다. 또한 같은 의미 행동 공간을 GUI 기반 시연 수집으로 확장한 GUMI(GUI Manipulation Interface)를 개발해, 특수 원격조작 장비 없이 인간과 에이전트가 여러 구현체에서 로봇을 조작할 수 있게 했다. 6
핵심 함의는 적절한 인터페이스가 있으면 추가 모델 용량이나 값비싼 구현체별 사전학습 없이도 기반 VLM에서 체화 능력을 끌어낼 수 있다는 것이다. Show-Harness는 의도와 행동을 연결하는 compact semantic interface를 통해 VLM을 로봇 제어에 활용하는 경로를 제시한다. 6