이 논문들은 하나의 공통 질문 아래 모인다. 언어모델이 내놓는 '겉보기 신호'를 우리가 얼마나 믿어도 되는가, 그리고 더 의미 있는 신호를 어떻게 만들고 평가할 것인가. 추론 흔적의 해석 가능성을 의심하는 연구에서 출발해, 학습 데이터의 표현 방식, 보상·테스트·평가 신호를 더 견고하게 다듬는 방법으로 이야기가 이어진다.
읽히는 추론이 곧 진짜 추론은 아니다: 사고 흔적의 해석 함정
쉽게 말하면: 언어모델이 문제를 풀며 늘어놓는 '생각의 과정'이 읽기 좋아 보인다고 해서 그 글이 실제로 어떤 단계가 정답에 중요했는지를 충분히 알려주지는 않는다는 것을 실험으로 보인 연구다. 1
최근 연구들은 사고 사슬(chain-of-thought)의 각 단계를 해석 가능한 단위처럼 다루며, LLM 심판이나 과정 보상 모델(process reward model), 생성형 비평가를 이용해 오류를 진단하고 단계별 감독 신호를 준다. 이 관행의 전제는 '단계의 텍스트가 그 단계의 기능적 역할에 대한 정보를 담고 있다'는 것인데, 저자들은 바로 이 전제를 검증하려 했다. 저자들은 한 단계의 중요도를 강화학습에서 말하는 어드밴티지(advantage), 즉 그 단계를 포함했을 때 정답에 도달할 기대 보상이 얼마나 바뀌는지로 정의하고, 몬테카를로 롤아웃으로 이 값을 추정해 정답(ground truth)으로 삼았다. 1
이 기준으로 LLM 심판이 어드밴티지가 높은 단계를 짚어낼 수 있는지 측정한 결과, 충분히 강력한 모델은 단순 빈도 기반 기준선(prevalence baseline)을 넘어서긴 하지만 노이즈 상한(noise ceiling)에는 크게 못 미쳤다. 단계별 비평가로 미세조정하면 '틀린 응답'에서는 크게 개선됐지만, '맞은 응답'에서는 여전히 상한과 멀었다. 1
이 연구의 함의는 분명하다. 단계 중요도가 텍스트에서 부분적으로만 복원된다는 결과는, 사고 흔적의 읽기 좋음을 해석 가능성으로 착각한 채 과정 보상 모델을 설계하는 실무 관행에 경고를 던진다. 특히 정답 응답에서 신호 복원이 어렵다는 비대칭성은 감독 신호 설계에서 주의해야 할 지점이다. 1
같은 지식을 여러 각도로 보여줄 때 모델은 더 잘 배운다
쉽게 말하면: 사전학습에서 같은 지식을 단순히 반복하는 것보다, 같은 지식을 다른 방식으로 재구성한 보조 관점(auxiliary views)을 함께 제공할 때 모델 학습이 더 좋아질 수 있음을 통제 실험으로 확인한 연구다. 2
지금까지 사전학습 데이터 연구는 중복 제거, 필터링, 범위와 깊이, 품질, 다양성 같은 코퍼스 수준의 성질에 집중했지만, '지식을 어떻게 표현해야 하는가'라는 질문은 상대적으로 비켜갔다. 저자들은 같은 지식을 다양한 형태로 재구성한 보조 관점의 효과를 분리해 측정하는 통제 실험을 설계했다. 2
네 가지 핵심 발견이 나왔다. 첫째, 지식 습득에는 반복이 필요하고 패러프레이즈도 도움이 되지만 그 효과는 배치 크기가 작을 때에 한정됐다. 둘째, 토큰 예산을 고정한 채 문서 반복에 쓸 토큰을 보조 관점으로 돌리면 학습이 개선됐고, 사실 회상에서도 이런 개선이 나타났다. 셋째, 보조 관점의 효과는 그것을 생성한 교사 모델의 성능에 좌우되지 않았다. 넷째, 사전 지식 공백이 있을 때 맥락적·기초적 지식이 학습을 도왔다. 저자들은 이 효과가 층별 편향과 압축 측면에서 어떻게 나타나는지도 분석했다. 2
이 연구는 '다양한 데이터가 왜 좋은가'에 대해 코퍼스 수준을 넘어선 설명을 제시한다. 다양한 지식 표현이 대규모 사전학습 코퍼스 안에서 자연스럽게 생겨나며, 이것이 사전학습 성공의 한 요인일 수 있다는 해석을 제공한다. 2
선호 학습의 불확실성을 저차원 부분공간에서 추적하기
쉽게 말하면: 사람의 선호로 보상 모델을 학습할 때 어떤 질문을 던져야 가장 효율적인지 알려면 모델의 불확실성을 알아야 하는데, 거대한 신경망 전체가 아니라 저차원 부분공간에서 이를 추적해 능동 선호 학습을 더 효율적으로 만든 연구다. 3
RLHF는 강력하지만 표본 효율이 낮다. 선호 비교 하나가 주는 정보는 최대 1비트에 불과해, 능동 학습(active learning)으로 정보량이 큰 질문을 골라야 하는데 이를 위한 불확실성 정량화가 큰 신경망 보상 모델에서는 난제였다. 저자들이 제안한 PreferenceEKF는 능동 선호 학습을 순차 베이즈 필터링 문제로 재구성한다. 3
핵심은 전체 파라미터 공간에서 사후 추론을 하는 대신, 저차원 파라미터 부분공간 안에서 확장 칼만 필터(EKF)로 순차 추론을 수행하는 것이다. 새 선호 질의가 들어올 때마다 보상 모델의 사후분포를 갱신하고, 이 부분공간에서 신경망 파라미터를 확장 가능하게 샘플링해 능동 보상 학습의 획득 함수를 효율적으로 계산한다. D4RL과 V-D4RL 벤치마크 실험에서 다른 베이지안 딥러닝 기법들보다 표본 효율, 실행 시간, 확장성, 캘리브레이션이 나았고, 학습한 보상 모델로 얻은 오프라인 강화학습 정책 성능도 경쟁력이 있었다. 3
이 연구는 확장 가능한 베이지안 방법이 선호 기반 보상 모델링에서 실용적일 수 있음을 보인다. 3
코드 검증을 스스로 배우는 모델: 건전하면서 공격적인 테스트 생성
쉽게 말하면: 코드 생성 모델이 자기 답을 검증할 테스트 케이스를 스스로 만들되, 참조 정답과 일치하면서 솔버의 현재 실패 양상을 겨냥하는 테스트를 강화학습으로 학습하게 한 연구다. 4
코드 LLM이 좋아지면서 병목은 그럴듯한 답을 만드는 데서 어떤 후보가 실제로 맞는지 검증하는 쪽으로 옮겨갔다. 코딩 문제의 실행 피드백은 주로 테스트 케이스에서 나오지만, 좋은 테스트 케이스는 건전하면서도 구별력이 있어야 하므로 부족하기 쉽다. 저자들은 테스트 자동 생성이 본질적으로 적대적 강화학습 문제임을 지적한다. 테스트 생성기는 솔버의 현재 실패 양상에 따라 효과적인 반례를 만들어야 하기 때문이다. 4
제안한 Test Cases Scaling(TCS)은 두 단계 강화학습 프레임워크다. 두 단계 모두 정책과 정렬된 롤링 버퍼(rolling policy-aligned buffer)로 테스트 생성기를 학습한다. 1단계는 참조 정답과 일치하는 테스트를 생성하도록 학습하고, 2단계는 버퍼를 현재 실패 양상으로 제한해 반례 테스트를 학습한다. 4
TACO와 LiveCodeBench에서 TCS는 pass@1과 생성 테스트에 따른 추론 시점의 답 선택을 모두 개선했다. 학습된 테스트 생성기가 다른 LLM 출력들 사이에서 효과적으로 선택하는 데도 도움이 됐다는 점이 실무적 의의다. 4
정확도만으로는 안전을 말할 수 없다: 비행 예측의 증거 기반 평가
쉽게 말하면: 비행 궤적과 자세를 예측하는 언어모델을 평가할 때 오차가 작아도 물리적으로 불가능하거나 안전 제약을 어기는 예측이 나올 수 있어, 그런 실패를 결정론적으로 잡아내는 평가 프로토콜을 만든 연구다. 5
물리 법칙이 지배하는 안전 필수 환경에서는 정답에 수치적으로 가까운 예측도 운항 제약을 위반하거나, 필드를 물리적으로 모순되게 조합하거나, 쓸 수 없는 구조화 출력을 낼 수 있다. 기존 평가 프로토콜은 이런 실패 양상을 신뢰성 있게 측정하지 못한다. 저자들은 FLY-EVAL++를 제안하는데, 프로토콜 준수·물리적 타당성·안전 제약을 결정론적으로 검증하고 고정된 루브릭으로 해석 가능한 다차원 점수로 집계하는 증거 기반 평가 프로토콜이다. 5
저자들은 PilotBench 환경을 확장해 이력 조건부 과제와 다단계 예측 과제를 포함한 비행 궤적·자세 예측(FTAP) 평가를 구성했다. 66개 LLM을 평가한 결과, 안전 준수가 모델 행동을 가장 잘 구분하는 차원이었다. 예측 성능이 비슷한 모델들이 안전 점수에서 28점 넘게 벌어졌고, 물리적으로 그럴듯한 예측에서도 안전 위반이 반복되며 다단계 롤아웃에서 불안정성이 드러나는 실패 양상이 관찰됐다. 5
이 연구는 안전 필수 영역의 평가가 정확도 중심 보고에 기대지 말고 제약 충족과 구조적 유효성을 명시적으로 측정해야 함을 보인다. 5
합성 이전에 먼저 보라: 영상 이벤트 전환의 시각적 근거 찾기
쉽게 말하면: 긴 영상에서 여러 사건을 찾아 설명하는 모델을 학습할 때, 사건 사이 빈틈마다 기계적으로 설명을 끼워넣는 대신 실제로 전환이 감지되는 곳에 시각적 근거를 가진 언어적 안내를 제공한 연구다. 6
약지도 밀집 영상 캡셔닝(WSDVC)은 영상별로 순서가 있는 사건 수준 캡션만 주어진 상태에서 여러 사건의 위치를 찾아 설명하는 과제다. 최근 방법들은 LLM으로 사건 사이 전환 캡션을 합성해 시각-언어 정렬을 보강했지만, 이런 캡션은 시각적 근거가 부족하고 모든 사건 간 빈틈에 고정된 위치·길이로 배정된다. 6
제안한 Seeing Before Synthesizing(SBS)은 VLM을 활용해 사건 사이 빈틈의 프레임별 서술을 생성하고, 이들 사이의 의미 변화를 바탕으로 전환을 감지한다. 전환이 확인되면 시간적 중점과 의미 변화 지점을 혼합해 사건 사이 시간 마스크를 정제하고, 시각-언어 정렬을 최대화하는 폭을 선택한다. 6
ActivityNet Captions와 YouCook2에서 SBS는 캡셔닝과 위치 지정 양쪽 모두 최고 성능(state-of-the-art)을 달성했다. 이 연구는 전환 보강을 텍스트만의 합성에서 시각적 근거를 가진 전환 이벤트 발견으로 재정의했다는 점에서 의미가 있다. 6