사례 연구 (Case-Study)

AI 뉴스룸 업무 자동화

젠아이랩스(GenAI Labs)의 AI 뉴스룸은 매일 기사를 수집하고, 매주 선별·작성·검증해 블로그와 뉴스레터로 내보냅니다. 수집부터 발송까지 자동으로 돌고, 사람은 발송 전 24시간 동안 초안을 검토해 발행하거나 보류합니다. 이 글은 그 과정을 실제 관리자 화면과 운영 기록으로 설명합니다.

NEWSROOM WORKFLOW

수집부터 발송까지 한 주의 흐름

자동으로 돌고, 발송 전에는 사람이 멈출 수 있습니다.

자동 실행사람

매일 06:00수집

  1. 소스 19곳에서 기사·논문 수집
  2. 주소 정규화로 중복 제거
  3. AI와 무관한 기사 제외
  4. 지식그래프 이름 매칭

일요일 08:00생성

  1. 약 1,000건에서 21건 선별
  2. 선별 기사 원문 확보
  3. 작성 · Claude
  4. 교차 검증 · OpenAI
  5. 표지 그림·각주
  6. 초안 저장, 미리보기 메일

일~월 24시간사람 검토

  1. 초안과 근거 확인
  2. 발행 또는 보류

월요일 08:00발행·발송

  1. 보류하지 않은 초안 발행
  2. 구독 분야별 본문 조립
  3. 구독자마다 1통씩 발송
  4. 열람·클릭 집계
  • 매일 01:20 백업데이터베이스와 그림을 외부 저장소로
  • 실행 기록단계별 수치와 오류를 남김
  • 실패 알림생성이 실패하면 메신저로
  • 다시 실행해도 안전글·발송이 중복되지 않음
적용 대상
젠아이랩스 블로그의 "금주의 AI동향"·"주간 논문 리뷰"와 주간 뉴스레터
기간
2026년 7월 ~ 운영 중
사용 기술
RSS·arXiv 수집, 유사도 기반 중복 병합과 선별, Claude 작성, OpenAI 교차 검증, 컨테이너 예약 실행, Amazon SES 발송
결과
누적 수집 20,930건 · 매주 약 1,000건에서 뉴스 15건과 논문 6편을 골라 글 2편 발행 · 주간 글 48편(24주 분, 운영 전 주차 소급 생성분 포함) · 생성 한 번에 약 10분
결과물
금주의 AI동향, 주간 논문 리뷰, 뉴스레터

추진 배경

AI 업계 소식은 매주 1,000건 넘게 나옵니다. 이것을 사람이 읽고 골라 정리하려면 매주 하루 이상이 듭니다. 한 주라도 거르면 구독자가 이탈합니다.

젠아이랩스는 기업에 AI 에이전트와 업무 자동화를 제안하는 회사입니다. 같은 방식을 자사 콘텐츠 업무에 먼저 적용했습니다. 반복되는 수집·선별·작성·발송은 자동으로 돌리고, 사람은 내보낼지 말지만 판단하게 했습니다.

구축 조건

  • 근거 없는 문장은 내보내지 않음 — 모든 문단에 출처를 달고, 근거가 확인되지 않는 문장은 발행 전에 삭제
  • 발송 전에 사람이 멈출 수 있음 — 초안이 나온 뒤 24시간 동안 검토하고 보류할 수 있음
  • 일부가 실패해도 전체는 계속 진행 — 소스 하나, 단계 하나가 실패해도 나머지는 계속 진행
  • 다시 실행해도 결과가 같음 — 같은 주차를 다시 돌려도 글이 두 번 발행되거나 메일이 두 번 가지 않음
  • 원문은 다시 배포하지 않음 — 원문은 요약과 검증에만 쓰고, 독자에게는 요약과 출처 링크만 제공

수집: 매일 06:00

소스 19곳에서 기사와 논문을 가져옵니다. 해외 기업 공식 블로그와 매체 8곳, 국내 매체 4곳, 개발자 커뮤니티 3곳, 논문 4곳(arXiv 3개 분류와 Hugging Face Daily Papers)입니다. 소스마다 가중치가 있고 관리자 화면에서 켜고 끕니다.

  • 중복 제거 — 주소에서 추적용 꼬리표를 떼고 정규화한 뒤 해시로 비교해, 같은 기사는 한 번만 저장
  • 무관한 기사 제외 — AI 관련 낱말이 하나도 없는 기사는 저장하지 않음. 지금까지 4,850건을 걸러 냄
  • 소스 단위 격리 — 한 소스가 응답하지 않아도 나머지 소스는 그대로 수집하고, 그날 실행은 "일부 완료"로 기록
  • 지식그래프 이름 매칭 — 수집 직후 등록된 기업·모델·인물 이름을 찾아 표시. 이 부분은 뉴스룸 지식그래프 사례에 따로 정리
뉴스룸 관리자의 소스 화면. 논문·해외·국내·커뮤니티 소스별 가중치와 이번 주 수집 건수, 사용 여부를 보여 준다.
소스 관리소스별 가중치와 이번 주 수집 건수를 보고 켜거나 끕니다.
뉴스룸 관리자의 실행 기록 화면. 날짜별 매일 수집 실행의 완료·일부 완료 상태와 수집 건수가 줄마다 적혀 있다.
실행 기록매일 수집이 몇 건을 가져왔고 어느 소스에서 오류가 났는지 남습니다.

정제·선별: 일요일 08:00

한 주 동안 모인 약 1,000건에서 글에 쓸 기사를 고릅니다. 뉴스 글에 15건, 논문 글에 6편입니다.

  • 같은 사건 묶기 — 유사도 0.82 이상인 기사는 한 묶음으로 병합. 여러 매체가 같은 발표를 다뤄도 한 번만 다룸
  • 순위 — 소스 가중치, 최신성, AI 관련도를 합쳐 점수를 매김. 논문은 학회 채택 표기가 있으면 가점
  • 쏠림 방지 — 해외 6건, 국내 6건, 커뮤니티 3건으로 분야별 자리를 나누고, 한 소스에서 최대 3건까지만 선택
  • 발행 보류 기준 — 고른 기사가 4건이 안 되면 그 주는 글을 만들지 않음
  • 원문 확보 — 고른 기사만 원문을 가져와 요약과 검증의 근거로 사용. 피드 요약 140자가 아닌 본문 수천 자를 근거로 삼음
뉴스룸 관리자의 수집 기사 화면. 주차별 수집 건수, 이번 주 많이 나온 이름을 모은 낱말 구름, 소스별 수집 수와 실제로 글에 쓰인 수를 보여 준다.
수집 기사2026년 38주차에는 1,057건을 모았고 그중 19건이 글에 쓰였습니다. 많이 나온 이름과 소스별 건수를 함께 봅니다.

작성·교차 검증

작성: Claude

고른 기사와 원문을 주고 글을 쓰게 합니다. 문단마다 근거로 삼은 기사 번호를 함께 내도록 출력 형식을 정했습니다. 기사에 없는 내용을 쓰지 못하게 하고, 문체와 용어 규칙은 프롬프트 파일에 따로 둡니다. 프롬프트는 코드에 넣지 않습니다.

교차 검증: OpenAI

글을 쓴 모델이 아닌 다른 회사의 모델이 문장을 근거 기사와 대조합니다. 뒷받침되면 유지, 과장이면 수정, 근거가 없으면 삭제합니다. 같은 모델이 자기 글을 다시 보면 같은 곳을 놓치기 때문입니다.

신뢰도 기준

검증 모델은 글 전체에 0~1 사이의 신뢰도를 매깁니다. 최근 세 주의 값은 0.84~0.88이었습니다. 0.85에 못 미치는 글은 자동으로 공개하지 않고 초안으로 남깁니다.

검증기 시험

초안에 지어낸 문장("A사가 화성에 데이터센터를 열었다")을 일부러 넣어 돌려 봤습니다. 검증 모델은 근거가 없다며 그 문장을 지우고 신뢰도 0.0을 돌려줬습니다.

검증을 통과한 글에는 표지 그림을 만들어 붙이고, 문단마다 각주 번호를 달고, 글 끝에 출처 목록을 만듭니다. 글 머리에는 AI가 만든 글이라는 표시와 수집·선별 건수가 들어갑니다.

공개된 금주의 AI동향 글의 머리 부분. AI 자동 생성·출처 검증 표시와 소스 19곳에서 1,057건을 수집했다는 안내가 보인다.
공개된 글의 머리AI가 만든 글이라는 표시와 수집 건수를 글 위에 밝힙니다.
공개된 금주의 AI동향 글의 본문. 문단 끝마다 출처를 가리키는 각주 번호가 붙어 있다.
문단마다 각주문단 끝의 번호가 글 끝의 출처 목록으로 이어집니다.

사람 검토: 24시간

일요일 아침에 초안이 만들어지면 담당자에게 미리보기 메일이 갑니다. 담당자는 월요일 08:00까지 관리자 화면의 "할 일"에서 초안과 근거를 확인합니다.

  • 그대로 둠 — 아무것도 하지 않으면 월요일 08:00에 자동으로 발행되고 발송됨
  • 발행 — 검토를 마친 글을 먼저 공개
  • 보류 — 내보내지 않기로 한 글은 자동 발행 대상에서 제외

사람이 매주 해야 하는 일은 초안을 읽는 것 하나입니다. 문제가 없으면 손댈 것이 없고, 문제가 있으면 보류 한 번으로 발송을 막습니다.

뉴스룸 관리자의 할 일 화면. 검토할 글 2편이 표지 그림, 제목, 신뢰도와 함께 나오고, 손대지 않으면 월요일 08:00 에 자동 발행 후 발송된다는 안내와 미리보기·지금 발행·보류 단추가 있다. 구독자 수와 열람률은 가렸다.
할 일: 검토할 글초안마다 신뢰도와 "손대지 않으면 어떻게 되는지"가 적혀 있고, 미리보기·지금 발행·보류 단추가 있습니다. 구독자 수와 열람률은 가렸습니다.
발행 전 초안 미리보기 화면. 위쪽에 관리자 미리보기이며 발행 전 초안이라는 띠가 있고, 글 머리에 미발행 초안 표시가 붙어 있다.
초안 미리보기발행될 모습 그대로 미리 봅니다. 발행 전이라는 표시가 붙습니다.

발행·발송: 월요일 08:00

  • 구독 분야별 본문 — 구독자가 고른 분야(업계·논문·커뮤니티)의 꼭지만 모아 메일 본문을 조립
  • 1통씩 발송 — 구독자마다 따로 보내고, 메일마다 그 사람의 수신 거부 링크를 넣음. 숨은 참조로 묶어 보내지 않음
  • 수신 거부 — 메일 프로그램의 수신 거부 버튼 한 번으로 즉시 해지. 사유는 묻지 않아도 됨
  • 중복 방지 — 글과 구독자의 짝마다 발송 기록을 남겨, 다시 실행해도 이미 받은 사람에게는 보내지 않음
  • 구독 확인 — 신청한 주소로 확인 메일을 보내 본인이 누른 경우에만 발송 대상에 넣음
뉴스룸 관리자의 뉴스레터 화면. 호마다 담은 글과 발송 상태가 줄로 나오고, 발송·열람 수치는 가렸다.
뉴스레터 발송 기록호마다 담긴 글과 발송 상태, 열람·클릭 분석으로 가는 단추가 있습니다. 수치는 가렸습니다.

운영

  • 실행 기록 — 모든 예약 실행이 단계별 수치와 오류를 남김
  • AI 사용량 — 작성·검증·그림·개체 추출 단계별로 호출 수와 토큰, 비용을 기록해 기간별로 확인
  • 백업 — 매일 01:20에 데이터베이스와 그림을 외부 저장소로 복사
  • 실패 알림 — 주간 생성이 실패하면 운영 메신저 채널로 알림
뉴스룸 관리자의 AI 사용량 화면. 기간과 단계별로 비용 막대그래프가 나오고 금액은 가렸다.
AI 사용량단계별 호출 수와 비용을 기간별로 봅니다. 금액은 가렸습니다.
뉴스룸 관리자의 콘텐츠 화면. 글 종류와 상태별 개수, 표지 그림과 제목, 발행일이 목록으로 나온다.
콘텐츠 목록종류와 상태별로 글을 찾고, 초안은 여기서 발행하거나 보류합니다. 조회 수는 가렸습니다.

결과

2026년 10월 1일에 운영 데이터베이스와 실행 기록에서 센 값입니다.

20,930누적 수집 기사·논문
약 1,000 → 21한 주 수집에서 선별
48주간 글(24주 분)
약 10분주간 글 2편 생성

주간 글 48편에는 운영을 시작하기 전 주차를 소급해 만든 글이 들어 있습니다. 예약 실행으로 매주 만들어진 것은 2026년 7월 26일부터입니다. 주간 글에 달린 출처는 434건입니다(뉴스 290건, 논문 144건).

  • 사람이 쓰는 시간 — 수집·선별·작성·발송에 손이 가지 않고, 매주 초안 검토만 남음
  • 거르지 않는 발행 — 예약 실행이 시작된 뒤 9월 20일까지 매주 발행. 9월 27일 한 주는 아래 시행착오의 사유로 빠짐
  • 추적 가능한 글 — 모든 문단이 출처로 이어지고, 어떤 기사에서 골랐는지 관리자 화면에 남음

시행착오

구축과 운영 과정에서 고장 났거나 다시 만든 부분입니다.

검증 모델 권한이 사라지자 한 주가 통째로 빠짐

2026년 9월 27일 주간 실행이 0건으로 끝났습니다. 교차 검증에 쓰던 OpenAI 모델의 사용 권한이 계정에서 빠져 있었습니다. 실패는 로그에만 남아 나흘 뒤에야 발견했습니다. 모델을 바꾸고, 주간 생성이 실패하면 즉시 메신저로 알리도록 고쳤습니다.

배운 점외부 모델에 기대는 단계는 실패를 가정하고, 실패는 사람에게 바로 알려야 합니다.

포털 뉴스 피드로는 원문을 읽을 수 없음

초기에는 포털의 뉴스 검색 피드를 국내 소스로 썼습니다. 피드가 주는 주소가 발행사 주소가 아닌 중계 주소여서 원문 추출이 되지 않았고, 인용 기사의 54%가 피드 요약 500자만 근거로 남았습니다. 실제 주소를 주는 국내 매체 피드 네 곳으로 바꿨습니다.

배운 점요약 품질은 근거로 넣는 원문의 분량에 달려 있습니다.

일반 IT 피드가 수집함을 채움

AI 전용이 아닌 IT 종합 피드는 기사의 73~82%에 AI 관련 낱말이 없었습니다. 관련도 필터가 선별 단계에만 있어 저장소가 무관한 기사로 찼습니다. 필터를 저장 전 단계로 옮겼고, 지금까지 4,850건을 저장하지 않고 걸렀습니다.

배운 점걸러 낼 것은 저장하기 전에 걸러야 합니다.

예약 작업이 전부 실행되지 않음

컨테이너 안 예약 실행기는 기본 실행 경로에 파이썬이 없고, 컨테이너의 환경 변수도 물려받지 않습니다. 그래서 초기에는 예약한 작업이 모두 시작하자마자 실패했습니다. 실행 경로를 명시하고 환경 변수를 작업 전에 읽도록 고쳤습니다.

배운 점손으로 실행해 되는 것과 예약으로 실행되는 것은 따로 확인합니다.

추론형 모델이 빈 답을 돌려줌

지식그래프 관계를 15건씩 묶어 검증할 때 빈 응답이 반복됐습니다. 추론형 모델은 출력 한도를 내부 추론에 먼저 써서, 한도가 작으면 보이는 답이 비게 됩니다. 한도를 올려 해결했습니다.

배운 점모델 계열이 바뀌면 같은 설정값의 뜻도 달라집니다.

배포 직후 실행 중이던 작업이 사라짐

홈페이지 화면을 배포하면 의존 관계 때문에 뉴스룸 컨테이너도 다시 떴습니다. 그 시각에 돌던 배치가 중간에 끊겼습니다. 배치는 같은 주차로 다시 실행해도 글과 발송이 중복되지 않게 만들어, 끊기면 다시 돌리면 되게 했습니다.

배운 점자동 작업은 중간에 끊겨도 다시 실행하면 같은 결과가 나와야 합니다.

남은 과제

  • 불안정한 외부 피드 — 커뮤니티 소스 한 곳이 매일 수집 80회 가운데 43회 응답하지 않음. 나머지 수집에는 영향이 없으나 대체 경로가 필요함
  • 열람률은 실제보다 낮게 집계 — 그림을 불러오지 않는 메일 프로그램에서는 열람이 잡히지 않아, 절대값이 아닌 추세로만 봄
  • 검증도 AI — 교차 검증은 같은 모델의 자기 채점을 피하는 장치이며, 사람이 표본을 검수해 정확도를 측정한 기록은 아직 없음
  • 외부 모델 의존 — 작성과 검증이 외부 회사 모델에 기대므로, 모델이 바뀌거나 막히면 그 단계가 멈춤

향후 계획

  • 검증 모델을 쓸 수 없을 때 다른 모델로 넘어가는 예비 경로
  • 사람이 표본을 검수해 요약 정확도를 수치로 기록
  • 반송과 스팸 신고를 받아 발송 대상에서 자동으로 제외

도입 지원

뉴스룸은 "정해진 시각에 자료를 모으고, 기준에 따라 고르고, 초안을 만들고, 사람이 승인하면 내보내는" 업무의 한 예입니다. 주간 보고서, 경쟁사·시장 동향 정리, 규제·공고 모니터링, 고객 문의 분류처럼 같은 모양의 업무에 같은 구조를 적용할 수 있습니다.

마치며

이 글의 화면 갈무리와 민감 정보 비식별화는 모두 AI가 자동으로 처리했습니다.

업무 자동화 도입 문의

반복되는 수집·정리·보고 업무를 자동화하는 방법을 검토 중이시면 연락 주세요.

문의하기

·