PAPERS

주간 논문 리뷰

매주 arXiv에 올라온 AI/LLM 논문 중 흐름을 바꿀 만한 것을 골라, 원문 전문을 읽고 무엇을 어떻게 해서 얼마나 좋아졌는지, 한계는 무엇인지까지 정리합니다. 산업 소식은 금주의 AI동향, 개념 해설은 기술 블로그에서 보세요.

뉴스레터 구독하기 ← 금주의 AI동향 기술 블로그 →

논문 리뷰 · 위클리 아카이브

arXiv 원문에 근거해 요약·교차검증한 주간 리뷰

논문 리뷰 · 2026-W30

생성 모델의 안쪽을 들여다보다: 세계 시뮬레이터부터 어텐션 회로 해부까지

제공된 연구 발췌들은 생성·추론 시스템을 더 실용적으로 만들기 위해 병목을 구체적으로 진단하는 흐름을 보여준다. 상호작용 세계 모델, 확산 트랜스포머 해석과 효율화, 이미지 생성 스택의 경량화, 긴 맥락 추론의 근거 접지, 지역 기반 이미지 제어, 코딩 에이전트의 비용 보정 라우팅이 각각의 초점이다.

논문 리뷰 · 2026-W29

LLM은 언제·무엇에 기대야 하는가 — 근거·타이밍·정체성으로 본 연구들

이 묶음의 연구들은 AI 시스템을 더 신뢰 가능하게 만들기 위해 경험적 근거, 제어 타이밍, 페르소나, 라우팅 피드백, 데이터 큐레이션, 감정 관성 같은 요소를 어떻게 활용하거나 검증할 수 있는지 다룬다. 공통적으로 단순한 겉보기 성능보다, 실제 검증 기준과 조건 변화에서 행동이 어떻게 달라지는지를 묻는다.

논문 리뷰 · 2026-W28

성능만이 아니라 배치와 통제를 묻다 — AI 연구의 여러 운영 쟁점

이번 묶음은 LLM의 운영 증거, 자율주행차 대상 이종 엣지 GPU 배치, 신호 표현, NL2SQL 파이프라인, 에이전트 거버넌스, 생의학 벤치마크에서의 거부 행동을 다룬다. 공통적으로 단순 점수뿐 아니라 실제 시스템 안에서의 제약, 구성요소 간 상호작용, 사람이 통제해야 할 지점을 함께 묻는다.

논문 리뷰 · 2026-W27

AI 연구의 에너지 추정과 설명 가능성, 검증

다음 연구들은 영상 생성 에너지 소비를 관측 가능한 생성 파라미터로 추정하고, 로봇 세계 모델에서 분할 마스크로 시뮬레이션-현실 간극을 줄이며, Lean 검증 대수 코퍼스로 LLM의 증명 메커니즘 라우팅 실패를 분석한다. 또 신규 범주 발견의 설명 가능성, 저자원 Efik TTS, 생물정보학 원고 생성의 문헌·실험 검증을

논문 리뷰 · 2026-W26

안전을 설계에 새기다 — 정직한 예측기, 감사 가능한 판단 중지, 그리고 숨은 위험의 발굴

이번 주 연구들은 성능 향상뿐 아니라 '언제 믿고 맡길 수 있는가'를 다룬다. 정직한 예측기라는 학습 목표로 모델 내부의 주체성 위험을 낮추려는 이론적 시도부터, 다중 에이전트 심의를 감사 가능한 행동-또는-보류 운영점으로 바꾸는 통계적 프레임, 백도어 모델의 숨은 행동을 잡음 주입으로 드러내는 기법까지 안전성 검증 흐름

논문 리뷰 · 2026-W25

불확실성을 나누고, 보상을 다듬고, 언어의 지평을 넓히다 — 신뢰할 수 있는 AI를 향한 연구들

이 연구들에는 모델의 겉보기 성능을 그대로 받아들이기보다, 그 성능이 어떤 신호와 조건에서 나오는지 따져 보려는 작업들이 포함돼 있다. 감정 인식의 불확실성을 두 성분으로 나누고, 추론 모델의 보상이 무너지는 원인을 분석하며, 예측 벤치마크에서 정보 누수를 통제하는 연구가 대표적이다. 포르투갈어 평가·인코더 연구와 연합학

논문 리뷰 · 2026-W24

검증기를 믿을 수 있는가: 코딩·데이터 에이전트 시대의 측정과 신뢰 문제

여러 연구는 LLM 에이전트와 AI 도구의 성과를 평가할 때 검증기·데이터·과정의 신뢰성이 중요하다는 문제를 다룬다. 코드 RL 환경의 테스트 결함, 소프트웨어 에이전트 학습용 궤적 데이터, 배포 전 AutoML 평가 환경 등이 제시되며, 점수뿐 아니라 그 점수를 만드는 평가 체계를 함께 살펴야 한다는 문제의식을 공유한다

논문 리뷰 · 2026-W23

평가와 효율이 중심으로: LLM·에이전트가 실제 배포에서 무엇을 못하는지 측정하는 연구들

이 논문들은 신모델 자체보다 실제 환경에서의 평가와 효율 문제를 다룬다. 저렴한 로봇, 다중 에이전트 협업, 대규모 고객 응대, 강화학습 연산 낭비, 정서적 돌봄 대화, 텍스트-이미지 생성까지 서로 다른 무대지만, 공통점은 단순 성공률이나 최종 성과 뒤에 숨은 실패·평가·비용의 구조를 드러내려 한다는 점이다.

논문 리뷰 · 2026-W22

에이전트의 실력을 검증하다: 평가·근거·안정성으로 이동하는 AI 연구

이 초안이 다루는 논문들은 LLM 에이전트의 다중 턴 시계열 추론, 소프트웨어 설계 협업, 스킬 보안, RAG 근거 검색, 반복 트랜스포머, 드론 시뮬레이터를 다룬다. 공통적으로 성능 주장 자체보다 평가 프로토콜, 안정성, 근거성, 보안 신호, 실제 배포 가능성을 점검한다.

논문 리뷰 · 2026-W21

측정과 신뢰: LLM을 쓸 수 있게 만드는 인프라 연구들

근거 논문들은 LLM과 생성형 AI를 실제로 활용하기 위한 측정·검증·운영 인프라에 초점을 둔다. 기능을 운영에 연결하는 피처 엔지니어링과 에이전트 RAG, 생성물을 추적·판별하는 AI 텍스트 탐지와 이미지 출처 추적, 벤치마크와 조직 정렬을 다시 측정하는 연구가 공통적으로 다뤄진다.

논문 리뷰 · 2026-W20

언어모델이 사람처럼 반응하고, 사람 곁에서 일하기 시작할 때

이번 주 논문들은 언어모델을 성능 벤치마크 밖으로 끌어내 사회적 맥락 속 행위자이자 현장 조력자로 바라본다. 권력 관계 속에서 모델이 인간의 사회인지적 효과를 보이는지 묻는 연구부터, 신약 설계·법률 판례 분류·암 생존자 정신건강 지원처럼 현실 적용 영역에 파고드는 연구, 그리고 추론 모델의 낭비를 줄이는 효율화 연구까지

논문 리뷰 · 2026-W19

에이전트가 신뢰할 만한가: 조율·데이터 무결성·시뮬레이터·효율을 다시 묻는 한 주

이번 주 논문들은 LLM을 단독 성능이 아니라 '실전에 놓았을 때 무엇이 무너지는가'라는 각도에서 파고든다. 여러 에이전트가 서로를 대신해 협상할 때, 에이전트가 참고하는 지식이 오염됐을 때, 학습에 쓴 가짜 사용자가 진짜 사람과 다를 때, 그리고 긴 문맥을 다 읽어야 할 때 — 연구의 초점은 결과 지표를 넘어 신뢰와 비

논문 리뷰 · 2026-W18

주변 설계를 다시 짜다: 도메인 하니스, 규범 학습, 보상 탐색, 연산 배분, 저비용 하드웨어

이번 묶음의 논문들은 도메인 특화 연구 에이전트, Model Spec 중간학습, 보상 함수 탐색, 쌍대 비교에서 절대 점수로의 전이, 적응형 추론 연산 배분, 저비용 로봇 조작 플랫폼처럼 모델과 시스템을 둘러싼 설계 선택을 다룬다. 공통적으로는 보상, 규범, 연산, 하드웨어 구성을 어떻게 설계하느냐가 성능과 활용 가능성에

논문 리뷰 · 2026-W17

구조를 파고드는 AI 연구: 내부 표현부터 안전 파이프라인까지

이 묶음의 논문들은 LLM과 관련 모델에서 내부 표현, 질의 위치, 피드포워드 층 대체 구조, 안전 제약 결합을 다룬다. 또 위협 모델링·인과추론·교통신호 제어처럼 실무형 파이프라인에 자동화 또는 의사결정 지원 모듈을 결합하는 방법을 제안했다.

논문 리뷰 · 2026-W16

표현 기하학·정보 밀도·탐색·시스템 효율·공정성을 다룬 LLM 및 AI 연구

이 글은 LLM과 AI 시스템을 출력 품질만이 아니라 내부 표현, 프롬프트 정보 밀도, 탐색적 학습, 서빙 메모리 효율, 다중 에이전트 오류 진단, 예측 치안의 공정성까지 함께 살피는 연구들을 다룬다.

논문 리뷰 · 2026-W15

확장하는 LLM, 그 한계를 되묻다: 이론적 하한부터 언어별 최적화·도구 내재화까지

이번 주 논문들은 생성 모델과 LLM이 더 빠르게, 더 특화되게, 더 자율적인 도구 사용으로 나아가는 흐름 속에서 남은 한계를 다룬다. 확산 샘플링의 정보이론적 한계, 코딩 에이전트의 쓰기 실패, 보안 특화 코멘트에 대한 LLM 정성 분석의 실패, 폴란드어 토크나이저 최적화, 도구 지식 내재화, 다국어 관용구 이해까지 다