논문 리뷰 · 2026-W33

쪼개고, 줄이고, 되돌아보며 나아가다 — 학습을 분해하는 실험과 오래 이어지는 과제를 다루는 에이전트

이 글은 젠아이랩스의 AI 자동화 봇이 이번 주 arXiv 논문 중 6편을 선별해 원문 전문을 읽고 요약·검증하여 자동 생성했습니다. 수치와 결과는 논문 원문에 근거합니다.

쪼개고, 줄이고, 되돌아보며 나아가다 — 학습을 분해하는 실험과 오래 이어지는 과제를 다루는 에이전트

이 글의 연구들은 크게 두 갈래로 모인다. 하나는 거대한 학습을 작은 조각으로 나눠 재조립하거나, 무거운 모델을 가볍게 압축하는 '분해와 경량화'의 실험이고, 다른 하나는 긴 호흡의 과제를 수행하고 평가하는 '장기 에이전트'의 등장이다. 상담 대화부터 과학 발견, 인터랙티브 월드 모델, 자동 디자인까지, 한 번의 응답이 아니라 여러 단계를 이어가는 능력이 공통 화두로 떠올랐다.

사전학습을 조각내 따로 훈련한 뒤 다시 붙일 수 있을까

쉽게 말하면: 거대한 언어모델을 한 덩어리로 통째 학습하는 대신, 층 블록으로 나눠 따로 훈련한 다음 나중에 하나로 조립해도 쓸 수 있는 모델이 되는지 실험한 연구다. 1

대규모 언어모델 학습은 보통 모든 층을 함께 최적화하는 하나의 거대한 실행으로 이뤄진다. 저자들은 사전학습을 독립적으로 훈련 가능한 작은 작업으로 분해했다가 나중에 하나의 일관된 모델로 재조립할 수 있는지를 물었다. 이 논문은 COLM 2026의 Methods and Opportunities at Small Scale(MOSS) 워크숍에 채택됐다. 1

핵심 방법인 Mixture of Training(MoT)은 목표 트랜스포머를 연속된 층 블록으로 나눈다. 각 블록은 얼려둔 사전학습 정렬기(aligner) 스캐폴드 안에서 따로 훈련되고, 이후 훈련된 블록들을 다시 조합한다. 조립 뒤에는 선택적으로 짧은 종단간 적응 과정을 거칠 수 있다. 1

C4로 학습한 1.3B 규모의 Gemma 계열 모델에서, MoT의 품질 동등(parity) 설정은 단일 통째 학습 기준선과 같은 보고 퍼플렉시티에 도달했다. 다만 이 설정은 더 많은 총 토큰을 처리하며, 정렬기 준비 이후의 이상화된 층 등가 임계 경로가 더 짧다는 성격을 갖는다. 저자들은 실효 컴퓨트 이점이 정렬기를 여러 실행에 걸쳐 재사용할 때에 달려 있다고 밝힌다. 또한 MoT를 통째 학습의 일반적 대체재가 아니라, 스캐폴드를 씌운 하위 실행이 재사용 가능한 학습 단위가 될 수 있는지 살펴보는 소규모 개념 증명으로 규정한다. 1

8층 교사를 1층 학생으로 압축한 실시간 음성 향상

쉽게 말하면: 잡음을 줄이는 무거운 음성 향상 모델을 얕은 모델로 압축해, 보청기나 화상회의처럼 지연과 실시간 처리 제약이 큰 상황에 맞추려는 연구다. 2

실시간 음성 향상은 과거와 현재 관측만으로 잡음과 잔향을 처리해야 하며, 알고리즘 지연과 실시간 계수(RTF) 제약을 동시에 지켜야 한다. 트랜스포머 계열은 키-값 캐시에 의존해 장시간 추론에서 메모리·대역폭 부담이 커질 수 있다. RT-SEMamba는 층마다 고정 크기의 순환 상태를 전파하는 인과적 시간-주파수 Mamba 블록을 써서 장시간 추론의 메모리·대역폭 효율을 높이려 한다. 2

저자들은 완전 인과적 음성 향상 모델인 RT-SEMamba를 제안했다. 여기에 점진적 지식 증류를 도입해 8층 교사의 복소 스펙트럼 출력과 중간 표현을 함께 증류하고, 이를 통해 얕은 1층 학생 모델로 압축한다. 2

Voicebank-DEMAND에서 8층 RT-SEMamba는 25ms 알고리즘 지연 제약 아래 PESQ 3.32를 기록했다. 증류된 1층 학생은 단순한 1층 기준선의 PESQ 3.06을 3.18로 끌어올리면서도 같은 정상 상태 RTF를 유지했고, 8층 교사 대비 2.75배 속도 향상을 달성했다. 저자들은 이 결과가 상태 공간 모델과 점진적 증류의 조합이 실시간 음성 향상에서 품질과 지연의 경쟁력 있는 균형을 제공할 수 있음을 보여준다고 설명한다. 2

앞을 미리 시뮬레이션해 상담 대화를 다듬는 선호 트리

쉽게 말하면: 상담 대화 AI가 지금 무슨 말을 할지 고를 때, 그 말이 앞으로 대화를 어떻게 끌고 갈지 여러 갈래로 시뮬레이션해보고 더 나은 선택을 학습하도록 만든 연구다. 3

여러 턴에 걸쳐 목표를 달성하는 대화 시스템은 전문 도메인일수록 데이터가 부족해 개발이 어렵다. 이 연구는 행동 변화를 돕는 상담 기법인 동기강화상담(MI)을 대상으로, 제한된 데이터 환경에서 목표 지향 대화 에이전트를 개선하는 방법을 제안한다. 3

제안된 Preference Tree Optimization(PTO)은 '앞을 내다보는 선호 트리(Preference Tree with Look-Ahead)'로 선호 데이터를 만든다. 가상 환자와 오라클 평가자를 활용해 대화를 시뮬레이션하고 풍부한 선호 데이터셋을 생성한 뒤, 직접 선호 최적화(DPO)와 결합해 에이전트의 의사결정 능력을 반복적으로 개선한다. 3

실험에서 PTO로 학습한 모델은 세션 만족도와 작업 동맹(working alliance) 같은 핵심 지표에서 기준선을 일관되게 앞섰다. 앞을 내다보는 시뮬레이션을 넣자 장기 계획과 대화 전략이 개선됐고, 더 깊은 look-ahead 설정이 가장 안정적이고 높은 점수를 냈다. 이 접근은 동기강화상담 같은 목표 지향 대화 도메인에서 선호 기반 학습을 활용할 수 있음을 보여준다. 3

논문을 읽고 도구를 쓰며 오래 추론하는 과학 에이전트 기반 모델

쉽게 말하면: 그림·문서·시계열 등 여러 형태의 과학 자료를 이해하고, 도구와 환경을 다루며 긴 과제를 수행하도록 설계한 과학 특화 기반 모델이다. 4

과학적 발견은 이질적인 증거를 바탕으로 추론하고, 과학 도구·환경과 상호작용하며, 긴 과제 지평에서 진전을 이어가는 능력을 요구한다. Intern-S2-Preview는 멀티모달 과학 이해, 추론, 생성, 장기 과제를 지원하도록 설계된 과학 에이전트 기반 모델 계열이다. 4

학습은 단계적으로 진행된다. 렌더링된 과학 문서와 이미지-텍스트 교차 데이터, 다양한 과학 말뭉치로 멀티모달 사전학습을 하고, 이어 지도 미세조정, 확장 가능한 다중 과제 강화학습, 블랙박스·화이트박스 에이전트 강화학습, 온폴리시 증류를 통합 후처리 파이프라인으로 적용한다. 부분 롤아웃과 오프폴리시 보정, 적응적 길이 정규화, 온라인 추측 디코딩, 강건한 다중 과제 최적화, 에이전트 과제를 위한 trace-aware experience assembly 같은 기법으로 롤아웃과 학습의 안정성·효율을 높인다. 구조 면에서는 Intern-S2-Preview-397B가 시계열 모델링을 효율적 장시퀀스 이해에서 수치 예측까지 확장하고, Memory Decoder는 얼려둔 397B 백본을 수정하지 않고 빠른 과학 특화를 시도하는 별도의 메모리 증강 경로로 연구됐다. 4

평가에서 Intern-S2-Preview-397B는 여러 과학·멀티모달·에이전트·범용 벤치마크에서 경쟁력 있거나 앞서는 결과를 냈다. 시계열 모듈은 SciTS에서 과학 신호 이해와 예측을 개선했고, 별도의 Intern-MemDec-4B 확장은 397B 백본을 수정하지 않고도 Biology-Instructions 평균 점수를 56.92에서 60.32로 끌어올렸다. 이 결과는 백본을 그대로 둔 별도 메모리 증강 경로가 과학 분야 특화에 활용될 수 있음을 보여준다. 4

사람처럼 목표를 좇는 에이전트로 월드 모델을 채점하다

쉽게 말하면: 사용자가 조작하며 탐험하는 영상 월드 모델을, 에이전트가 실제로 목표를 좇으며 상호작용해 비교·평가하는 벤치마크다. 5

영상 월드 모델은 현재 관측과 사용자 행동에 따라 미래 상태를 시뮬레이션한다. 문제는 공정한 비교가 어렵다는 점이다. 사람은 보통 '360도 돌아 환경이 일관된지 본다'처럼 장기 목표를 좇아 모델을 평가하는데, 같은 목표를 이루는 데 필요한 행동 시퀀스가 모델마다 크게 달라 고정된 행동 조건 평가로는 서로를 비교하기 어렵다. PlayWorld는 이 문제를 겨냥한다. 5

핵심은 멀티모달 Agent Player가 지정된 장기 목표를 향해 월드 모델과 상호작용하도록 하는 것이다. PlayWorld는 목표가 지정된 171개 시나리오를 제공하며, 기하 일관성, 상호작용 충실도, 시야 밖 상태 변화, 시야 내 상태 변화라는 네 가지 핵심 차원으로 모델을 평가한다. 여기에 비디오 품질과 제어 가능성에 관한 기본 능력 지표도 함께 포함한다. 5

최신 월드 모델 9종을 이 방식으로 평가한 결과, 현재 모델들은 장기 인터랙티브 목표에서 여전히 신뢰하기 어려웠으며, 특히 공간 일관성 유지와 지속적 상태 변화에서 약했다. 같은 목표라도 모델마다 필요한 행동 시퀀스가 달라지는 문제를, 목표를 공유하고 에이전트가 상호작용하는 방식으로 평가하려는 점이 이 연구의 핵심이다. 5

디자인 도구 자체를 스스로 개선하는 메타 최적화

쉽게 말하면: 논문을 포스터로 바꾸는 AI가, 결과물 하나만 고치는 것이 아니라 만드는 하네스 시스템 자체를 롤아웃 피드백에 따라 개선하도록 만든 연구다. 6

멀티모달 자료를 압축된 구조화 결과물로 바꾸는 일은 모델과 하네스 시스템을 중심으로 한 장기 에이전트 과정으로 볼 수 있다. 이상적인 하네스는 인간의 디자인 선호와 정렬되고, 경험을 축적해 재귀적으로 자기개선할 수 있어야 한다. 기존 패러다임은 정적이어서 이런 능력이 부족하다는 문제의식에서 AutoDesign이 제안됐다. 6

AutoDesign은 인간의 디자인 선호와 정렬된 프레임워크로, 메타 하네스 최적화기가 롤아웃 피드백을 바탕으로 코드 에이전트를 안내해 하네스를 재귀적으로 개선한다. 저자들은 이를 학술 논문을 포스터로 변환하는 과제로 구체화하고, 100편의 논문으로 구성된 5개 분야 PosterBench Main Track과 통제 평가용 10편 부분집합인 PosterBench-mini를 제시했다. 6

PosterBench Main Track에서 AutoDesign은 78.32점으로 최고 점수를 기록했고, 상용 폐쇄 시스템 Claude Design을 7.45점 앞섰다. 7개의 통제된 코드 에이전트-모델 구성에 학습된 DesignHarness를 붙이자 평균 PosterBench 점수가 54.99에서 67.39로 올랐다. 완전 자율 장기 루프에서는 40분 안에 253회의 도구 호출과 11회 편집을 수행했고, 비용은 3달러 미만이었으며, 인간 평가에서 평균 학회 포스터 수준에 도달했다. 결과물이 아니라 생산 시스템 자체를 진화시키는 이 메타 최적화 관점은, 디자인 워크플로를 재사용 가능한 하네스 개선 문제로 다룬다는 점에서 의미가 있다. 6

출처

  1. Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model · 2026-08-13
  2. RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation · 2026-08-12
  3. Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations · 2026-08-12
  4. Intern-S2-Preview: Scientific Agentic Foundation Model · 2026-08-13
  5. PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives · 2026-08-13
  6. AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design · 2026-08-13
뉴스레터로 매주 받아보기 ← 금주의 AI동향