논문 리뷰 · 2026-W39

겉으로 드러나는 성능 지표의 함정 — 모델 내부의 신뢰성을 캐묻다

이 글은 젠아이랩스의 AI 자동화 봇이 이번 주 arXiv 논문 중 6편을 선별해 원문 전문을 읽고 요약·검증하여 자동 생성했습니다. 수치와 결과는 논문 원문에 근거합니다.

겉으로 드러나는 성능 지표의 함정 — 모델 내부의 신뢰성을 캐묻다

여기 소개하는 연구들은 '표면의 좋은 수치가 곧 좋은 모델인가'를 의심한다. 멀티모달 내부 정렬 지표가 내용 수준 상호작용을 직접 보장하지 않음을 보이고, 그리디 디코딩이 정밀도 설정에 따라 달라질 수 있음을 드러낸다. 또 LLM 기반 합성 설문에서 문화 간 차이가 평탄화되는 현상을 계측하고, 긴 추론과 복잡한 계획에서 드러나는 취약성을 구조적으로 다루며, 불완전한 멀티모달 입력에 LLM 기반 잠재 의미를 도입해 견고성을 높인다.

정렬 점수가 높아도 모델은 그림을 안 보고 있었다

쉽게 말하면: 멀티모달 모델의 내부 정렬 지표가 실제 시각 정보 활용을 보장하지 않는다는 진단이다. 투입 이미지를 교란해도 일부 정렬 스칼라 값은 손상을 일관되게 구분하지 못했다. 1

멀티모달 대형언어모델(MLLM)에서 층별 시각-텍스트 유사도가 깊이에 따라 올라가는 현상은, 보통 언어모델이 시각 정보를 공유 표현 공간으로 점진적으로 통합한다는 증거로 읽혀 왔다. 저자들은 이 해석의 전제를 통제 실험으로 직접 검증한다. 투영기(projector) 출력 단계의 시각 토큰을 가우시안 노이즈로 바꾸면 과제 정확도는 급락하는데, CKA·SVCCA·MIR·주각(principal-angle) 코사인 같은 네 가지 표준 스칼라 지표는 손상된 스트림과 원본을 일관되게 구분하지 못했다. 이 실패를 저자들은 '정렬 착시(alignment illusion)'라 부른다. 1

원인은 시각 토큰과 텍스트 토큰이 같은 트랜스포머 블록을 거친다는 구조에 있다. 비등방적(anisotropic) MLP 하향 투영이 두 모달리티를 공통 출력 방향으로 끌어당기면서, 내용과 무관하게 '가중치가 유도한 정렬'을 만들어낸다. 이 성분이 본질적으로 1차원이라는 점에 착안해, 저자들은 상위 두 주각 코사인의 차이인 '주각 간극(PA gap)'을 제안한다. 등급을 나눈 시각 손상 실험에서 PA gap은 기존 스칼라 점수보다 과제 정확도를 더 일관되게 추적했고, 구조는 있으나 무관한 이미지를 넣는 조건에서는 내부 기하와 정확도가 어긋나는 영역까지 드러냈다. 1

실험은 다섯 계열 13개 MLLM(0.5B~72B)에 걸쳐 수행됐다. 결론적으로 내부 시각-텍스트 정렬은 내용 수준의 교차모달 상호작용을 직접 대변하기보다, 언어모델 내부의 시각 스트림 기하를 진단하는 지표로 읽어야 하며 통제된 과제 근거로 보정될 때 가장 유의미하다. 1

같은 모델·같은 프롬프트인데 BF16과 FP16의 답이 갈린다

쉽게 말하면: 무작위성을 없앤 그리디 디코딩이면 늘 같은 답이 나올 거라 믿었지만, 수치 정밀도(BF16이냐 FP16이냐)만 바꿔도 같은 하드웨어에서 다른 문장이 나온다는 발견이다. 2

그리디 디코딩은 흔히 결정론적으로 취급된다. 저자들은 이것이 정밀도 불변이 아님을 보인다. 동일한 모델·프롬프트·디코딩 알고리즘이 동일 하드웨어에서 BF16과 FP16으로 서로 다른 출력을 낸다. 1.1B~7B 규모 네 계열 여섯 모델과 세 벤치마크에 걸쳐 49~100%의 프롬프트가 갈라졌으며(12B에서도 추가로 특성화), 토큰 하나가 뒤집히면 그것이 궤적 전체의 분기로 번지는 경우가 많았다. 2

저자들은 경험적 오차 전파 분석을 전개해, 22개 층에 걸쳐 누적된 본체(body) 오차는 뒤집히는 단계와 아닌 단계를 구분하지 못한다는 것을 밝힌다. 결과를 가르는 것은 주로 LM 헤드에서의 상위 두 로짓 마진이, 두 후보 사이 방향성 섭동에 비해 얼마나 큰가였다. 이 분석은 개입 결과에 대한 다섯 가지 검증 가능한 예측을 내놓는데, FP32 연산을 더 넓게 적용할수록 오히려 일치도가 나빠진다는 예측까지 포함해 실험이 다섯 예측을 모두 맞혔다. 2

가장 효과적이면서 부담이 적은 개입은, 마진이 임계값 아래로 떨어질 때만 LM 헤드를 FP32로 선택적 재계산하는 방법이었다. 저배치(배치 크기 ≤4) 단일 스트림 추론에서 A10G 기준 정확 일치를 +22~36%p(L4·A100에서 +12~21%p) 올리면서 지연 오버헤드는 4% 미만이었다. 다만 이것은 보편적 결정론 보장이 아니라 부분적 완화다. 본체 유래 오차가 지배하는 조건, 즉 배치 크기 ≥8이나 종단간 FP8에서는 효과가 사라졌다. 2

LLM이 만든 설문 응답은 문화 차이를 조용히 뭉갠다

쉽게 말하면: LLM으로 여러 나라 사람들의 설문 응답을 흉내 낼 때, 기존 지표로는 잘 맞아 보여도 실제로는 나라 사이의 차이가 밋밋하게 지워지는 '평탄화'가 일어난다는 것을 잡아내는 진단 도구다. 3

LLM은 합성 설문 응답자로 점점 많이 쓰인다. 하지만 교차문화 설문 시뮬레이션에서는 나라 안의 분포 충실도뿐 아니라 나라 사이 차이가 보존되는지도 평가해야 하는데, 옌센-섀넌 발산(JSD) 같은 거리 기반 지표는 이 교차국가 차이를 직접 포착하지 못한다. 저자들은 한 번의 인간 보정으로 작동하는 가벼운 진단 지표 CDP(문화적 발산 보존)를 제안한다. CDP는 교차국가 발산이 줄면 '문화적 평탄화', 늘면 '문화적 희화화(caricature)'로 식별한다. 3

네 개 LLM, 세 가지 페르소나 프롬프팅, 두 설문 도메인(세계가치관조사 WVS, 빅파이브 성격검사)에 걸친 검증에서 체계적 불일치가 드러났다. 통제 실험에서 교차국가 발산을 약화·증폭시키면 CDP는 단조롭게 변하는 반면 JSD 변화는 상대적으로 작았다. 실제 LLM 생성 감사에서는 'DeepPersona 기반' 프롬프팅이 전통적 충실도 지표에서는 자주 선호됐지만, 모든 모델–도메인 블록에서 가장 강한 평탄화를 보였다. CDP는 이렇게 충실도 지표를 보완하며, 교차국가 발산의 약화나 과장을 직접 정량화한다. 3

긴 추론이 무너지는 두 가지 편향을 구조로 다스리다

쉽게 말하면: 수십 단계를 거쳐야 하는 긴 추론에서 LLM이 '그럴듯하지만 끝내 틀린' 길로 빠지는 이유를 두 종류 편향으로 규정하고, 추론 공간의 구조를 이용해 이를 잡아주는 방법이다. 4

보상이 드문(sparse-reward) 상황에서 긴 추론은 LLM의 고질적 난제다. 저자들은 그 취약성을 두 편향으로 나눈다. 하나는 국소적으로 그럴듯하지만 구조적으로 불안정한 가지로 끌려가는 '탐색 편향', 다른 하나는 작은 국소 이탈이 깊이를 따라 누적되며 드문 보상을 억눌러버리는 '누적 편향'이다. 이를 분석하기 위해 '기호적 폐포 분석(SCA)'이라는 이론틀을 도입해, 분기 구조와 희소 보상이 어떻게 두 편향을 유발하는지를 국소 허용성(local admissibility) 관점에서 특성화한다. 4

이 진단을 학습 신호로 옮긴 것이 SAGE다. 두 가지 구조적 안내를 결합하는데, 하나는 국소 허용 후보를 연산자 인덱스 대수 부분공간에 투영해 허위 분기를 억제하는 '대수적 희소화'로 탐색 편향을 완화하고, 다른 하나는 추론 상태를 음의 곡률 공간(쌍곡 공간)에 묻어 깊이 방향으로 조밀한 신호를 주는 '쌍곡 구조 안내'로 누적 편향을 완화한다. 정책 최적화 과정에 구조적 안내를 주입해, 학습된 정책이 구조화된 추론 공간의 유용한 성질을 내재화하도록 하는 설계다. 4

7개 모델 계열과 12개 벤치마크(수학·자연 추론 등)에 걸쳐 SAGE는 경쟁 기준선을 일관되게 앞섰다. 특히 실세계 긴 추론 과제인 앤드루스-커티스(AC) 문제에서 최대 8배 향상을 달성했다. 4

복잡해질수록 무너지는 계획 수립을 세 단계로 쪼개다

쉽게 말하면: 과제가 복잡해지면 LLM이 계획을 세우다 혼선을 일으키는데, 생성·수정·평가를 서로 격리된 모듈로 나눠 그 붕괴를 막는 틀이다. 5

LLM은 과제 복잡도가 올라갈수록 신뢰도가 떨어지는 성능 프로파일을 보인다. 이를 해결하기 위해 GRASP는 계획 파이프라인을 전문화된 맥락 격리 모듈로 분리한다. 전역 거시 지침을 미리 컴파일하는 GenPlan, 격리된 맥락 창 안에서 국소 전략 대안을 탐색하는 RevPlan, 다기준 판별기로 궤적을 독립 평가하는 VerPlan의 세 단계다. 5

실험에서 GRASP는 직접 LLM 계획자 대비 Natural Plan 일정 수립에서 12.4%, ZebraLogic에서 30.8%, SciBench 수학에서 상당한 정확도 향상을 보이며 새 최고 성능 경계를 세웠다. 특히 표준 계획자가 즉각 성능 붕괴를 겪는 다중 과제 확장 상황에서 GRASP는 다중 과제 열화 페널티를 완전히 평탄화했고, 교차된 이중 과제 환경에서는 최대 16.7%p의 절대 정확도 이득을 냈다. 맥락 격리와 엄격한 거시 규제를 통해 GPT-5-mini 같은 최전선 추론 모델까지 14.5% 차이로 앞섰다. 5

불완전한 멀티모달 입력을 LLM의 숨은 의미로 메우다

쉽게 말하면: 영상·음성 일부가 손상되거나 빠진 상태에서 감정을 읽어야 할 때, 빠진 신호를 억지로 복원하는 대신 LLM이 가진 고차원 의미로 채워 넣는 방법이다. 6

멀티모달 감정 분석(MSA)은 언어·시각·음성에서 사람의 감정을 추론하는데, 실제 환경에서는 노이즈나 결측으로 관측이 불완전한 경우가 많다. 기존 접근은 두 갈래다. 복원 기반 방법은 부분 관측에서 완전한 특징을 되살리려 하지만, 고차 의미 기반이 부족해 허위 생성과 노이즈성 안내에 취약하다. 융합 기반 방법은 가용 모달리티를 복잡한 교차모달 상호작용으로 통합하지만, 역시 고차 의미 정착의 부족으로 한계가 있다. 6

SemMSA는 LLM으로 감정 관련 의미를 구성해 모든 모달리티에 통합하는 잠재 의미 보조 틀이다. 교차모달 의미 정제(CSR)는 가벼운 어댑터로 시각·음성 표현을 적응적으로 추출해 얼어 있는 LLM 임베딩 공간에서 언어와 함께 통합 멀티모달 접두부를 만들고, 명시적 텍스트를 디코딩하지 않은 채 토큰 효율적인 잠재 정제 과정으로 연속적 판별 의미 상태를 반복 생성한다. 이어 교차모달 스펙트럼 정렬(CSA)은 정규화된 의미·언어·시각·음성 표현의 커널 그램 행렬에서 지배적 스펙트럼 성분을 강화해, 미리 정한 기준 모달리티 없이 모든 표현을 동시에 정렬한다. 인스턴스 단위 스펙트럼 분리 제약으로 표본 간 판별력을 보존해 표현 붕괴도 막는다. 6

SIMS·MOSI·MOSEI 벤치마크에서 SemMSA는 최고 성능(state-of-the-art)을 달성했다. 6

작성: AI (Claude Opus 4.8)

출처

  1. The Alignment Illusion in Multimodal Large Language Models · 2026-09-24
  2. Greedy Decoding Is Not Precision-Invariant: Cross-Precision Output Divergence in LLM Inference · 2026-09-22
  3. Cultural Divergence Preservation: Diagnosing Flattening and Caricature in LLM-Simulated Survey Populations · 2026-09-24
  4. SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance · 2026-09-24
  5. GRASP: Generating, Revising, and Assessing for Strategic Planning with Agentic AI · 2026-09-24
  6. SemMSA: Latent Semantic-Aided Robust Multimodal Sentiment Analysis with Incomplete Data · 2026-09-24
뉴스레터로 매주 받아보기 주간 논문 리뷰 목록