이번 주에 읽을 ML 시스템 연구 4편: 장기 에이전트, 스킬 보안, 문서 추출, RAG 확장성
에이전트의 장기 상태를 어떻게 검증할지, 학습된 스킬이 어떻게 공격 표면이 되는지, 기업 문서 추출과 대규모 RAG를 어떤 지표와 비용으로 평가할지 네 편의 최신 연구로 살펴봅니다.
이 글은 공개 논문과 1차 프로젝트 자료를 바탕으로 AI의 도움을 받아 만든 주간 연구 다이제스트입니다. 중요한 판단이나 구현에 사용하기 전에는 연결된 원문을 직접 확인하세요.
이번 주 선정 기준
이번 주에는 모델 크기보다 시스템 경계와 평가 설계에 직접 적용할 수 있는 연구를 골랐습니다. 네 논문은 각각 상태를 컨텍스트 밖에서 관리하는 법, 경험을 스킬로 승격할 때 생기는 보안 위험, 정확도와 근거·비용을 함께 재는 문서 추출 평가, 검색 규모가 커질 때 단순한 전역 랭킹이 갖는 힘을 보여줍니다. 화려한 단일 점수보다 실패가 어디에서 생기고 운영자가 무엇을 측정해야 하는지에 초점을 맞췄습니다.
빠르게 보기
- LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks · arXiv 2608.01964
- SkillJack: Persistent Skill Backdoors in Self-Evolving Agents · arXiv 2608.03509
- ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction · arXiv 2607.29677
- Which RAG Paradigm Wins at Scale? A Scaling Study of Retrieval-Augmented Generation Paradigms · arXiv 2607.26497
1. LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
- arXiv: 2608.01964
- 발표일: 2026-08-03
- 저자: Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang, Shidong Yang, Yiming Hu, Fei Wei, XiangXiang Chu
무엇을 연구했나
이 논문은 긴 작업을 하나의 계속 커지는 대화로 처리하지 않고, 명시적인 작업 상태를 실행 컨텍스트 밖에 두는 LongHorizon-Harness를 제안합니다. 매 라운드는 관리자가 검증 가능한 하위 작업 계약을 만들고, 새 컨텍스트의 실행자가 환경을 바꾸며, 읽기 전용 감사자가 실제 환경 상태를 확인하는 Manage–Execute–Audit 루프로 구성됩니다. 다음 라운드에는 실행자의 전체 궤적이 아니라 감사된 상태와 보고서만 전달됩니다.
왜 추천하나
긴 에이전트 작업에서 중요한 것은 더 큰 컨텍스트만이 아니라 상태의 소유권과 승격 조건이라는 점을 실험으로 보여줍니다. 데이터 파이프라인의 체크포인트나 워크플로 오케스트레이터처럼, 관측된 환경 사실만 다음 상태로 승격하는 구조는 코딩 에이전트와 운영 자동화를 설계할 때 바로 적용할 수 있습니다.
핵심 결과
- 같은 Qwen 3.7-Plus와 Claude Code 실행 백엔드를 사용한 비교에서 WeaveBench 완전 통과율이 51.8%에서 80.7%로 올라, 모델 교체가 아닌 상태 관리 계층의 효과를 분리했습니다.
- OSWorld 2.0에서는 Qwen 3.7-Plus의 완전 성공률이 2.8%에서 8.3%, 부분 점수가 21.5%에서 35.2%로 올랐고, Claude Opus 4.7의 34개 작업 부분집합에서도 완전 성공률이 20.6%에서 35.3%로 상승했습니다.
- Terminal-Bench 2.1에서는 같은 Qwen 백본의 성공률이 69.7%에서 77.2%로 올라, GUI와 CLI가 섞인 작업뿐 아니라 순수 명령줄 장기 작업에도 감사된 상태가 도움이 됐습니다.
한계와 읽을 때의 주의점
- 성능 향상은 공짜가 아닙니다. Qwen 설정에서 토큰 사용량은 WeaveBench에서 기준선의 2.3배, OSWorld 출력 토큰은 3.6배였고, 감사자가 전체 토큰의 약 19~38%를 사용했습니다.
- 독립 감사는 잘못된 결과를 감지하고 복구를 시작할 수 있지만, 시각 인식·수학·코딩처럼 백본 모델에 없는 능력을 만들어내지는 못합니다. 일부 짧은 분석 작업군에서는 개선이 작거나 퇴보했습니다.
원문과 프로젝트 자료
2. SkillJack: Persistent Skill Backdoors in Self-Evolving Agents
- arXiv: 2608.03509
- 발표일: 2026-08-04
- 저자: Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo
무엇을 연구했나
SkillJack은 에이전트가 과거 경험을 재사용 가능한 스킬로 추출하는 과정 자체를 공격합니다. 공격자는 스킬 저장소나 추출 코드를 직접 바꾸지 않고, 간접 프롬프트 주입이나 공유 경험 풀을 통해 오염된 궤적만 학습 코퍼스에 넣습니다. 에이전트의 추출기가 이를 정상적인 기능 설명과 코드가 붙은 스킬로 승격하면 악성 의도가 표면상 정제되고, 원본 경험을 지운 뒤에도 별도 스킬 아티팩트로 남을 수 있습니다.
왜 추천하나
메모리 오염을 단순히 검색 시점의 컨텍스트 문제로만 보면 놓치는 수명주기 위험을 보여줍니다. 자동화된 에이전트가 경험을 규칙·도구·스킬로 승격한다면 데이터 계보, 리뷰, 폐기, 재검증을 모델 파일과 동일한 공급망 문제로 다뤄야 한다는 강한 근거가 됩니다.
핵심 결과
- SkillX에서 LLM 안전 판정기가 오염된 원본 궤적의 98.5%를 탐지했지만 추출된 스킬에서는 11.4%만 탐지했습니다. A2S 문서 모드에서도 원본 100% 대비 추출 스킬 44.4%로 같은 방향의 정제 효과가 나타났습니다.
- 25개 공격 지향 작업에서 스킬 경로의 트리거율은 40.0%였고 원본 궤적을 삭제한 뒤에도 32.0%가 남아, 한 번 트리거된 공격의 80.0%가 원본 삭제 이후에도 지속됐습니다.
- SkillX 표본에서 코드만 보여줄 때 탐지율은 36.7%였지만 정상적으로 보이는 이름과 문서를 함께 보여주면 10.0%로 낮아졌습니다. 표면 메타데이터가 정적 안전 판정에 크게 영향을 준다는 결과입니다.
한계와 읽을 때의 주의점
- 모든 추출·라우팅·판정 실험은 DeepSeek-v4-flash 한 모델에 의존하므로 다른 모델과 스킬 시스템에서도 같은 비율이 재현되는지는 아직 확인되지 않았습니다.
- 공격 성공은 실제 외부 서비스 실행이 아니라 패턴과 LLM 판정을 결합한 정책 위반 프록시로 측정됐습니다. 방어 실험도 표본이 작고 일부 런타임 규칙은 실패를 본 뒤 추가되어 탐색적 결과로 봐야 합니다.
원문과 프로젝트 자료
3. ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
- arXiv: 2607.29677
- 발표일: 2026-07-31
- 저자: Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo
무엇을 연구했나
ExtractBench는 사용자 스키마에 맞춰 기업 문서에서 값을 추출하고 그 값의 근거 위치까지 반환하는 시스템을 평가합니다. 8개 비즈니스 도메인과 67개 문서 유형에서 370개 문서, 4,869페이지를 구성하고, 긴 목록·needle-in-a-haystack·조밀한 양식, 스캔·필기, 복잡한 표, 문서 길이를 독립 태그로 나눕니다. 값 정확도뿐 아니라 레코드 완전성, 단어·페이지 수준 근거, 페이지당 비용을 함께 측정합니다.
왜 추천하나
문서 AI를 단일 정확도 점수로 평가하면 긴 배열의 뒷부분을 잘라낸 실패와 값 하나를 틀린 실패가 섞입니다. 이 논문은 스키마를 실행 가능한 계약으로 보고, 순서 없는 레코드 정렬·명시적 null·근거 위치·페이지당 비용을 분리해 측정합니다. 데이터 품질과 감사 가능성을 함께 설계하는 데 유용한 평가 템플릿입니다.
핵심 결과
- 값 평가는 스칼라와 배열을 셀 단위로 평탄화하고, 반복 레코드는 Hungarian algorithm으로 순서와 무관하게 정렬합니다. 누락 키는 명시적 null로 계산하며 LLM judge 없이 정규화 후 exact match를 사용합니다.
- 평가된 VLM은 대체로 페이지당 1센트 이하였지만 80% F1을 넘지 못했고, 코딩 에이전트는 87~94% F1에 도달했으나 페이지당 15센트 이상이 들었습니다. LlamaExtract Agentic Plus는 8.1센트에서 95.6% F1을 보고했습니다.
- 1,000행이 넘는 거대 표에서 모든 VLM이 10% 미만으로 떨어진 반면 상위 전문 API와 Claude Code는 훨씬 높은 완전성을 유지했습니다. 그러나 가장 좋은 전문 시스템도 단어 수준 grounding F1이 50% 미만이어서 정확한 값과 정확한 증거를 함께 연결하는 문제는 남았습니다.
한계와 읽을 때의 주의점
- 일부 실제 문서의 정답은 여러 추출 시스템의 합의와 불일치에 대한 사람 검토로 만들었습니다. 단일 시스템 편향은 줄이지만, 평가 대상과 비슷한 모델군이 정답 구성에 참여하는 데서 오는 잔여 편향 가능성은 남습니다.
- 시스템과 가격은 2026년 7월 1일 가용 버전을 기준으로 하며, 벤치마크 저자 측 전문 API가 품질·비용 frontier를 주도합니다. 다른 데이터 분포와 독립 재현에서 순위가 유지되는지 확인할 필요가 있습니다.
원문과 프로젝트 자료
4. Which RAG Paradigm Wins at Scale? A Scaling Study of Retrieval-Augmented Generation Paradigms
- arXiv: 2607.26497
- 발표일: 2026-07-29
- 저자: Pengyu Wang, Benfeng Xu, Shaohan Wang, Xin Zeng, Huarui Wu, Lei Zhang, Licheng Zhang
무엇을 연구했나
이 논문은 BM25, dense retrieval, 여러 graph RAG, 인덱스 없이 파일 트리를 탐색하는 에이전트를 서로 다른 벤치마크가 아니라 하나의 통제된 corpus ladder에서 비교합니다. 관련 문서와 교란 문서를 고정한 bedrock 위에 동일한 순서의 문서를 추가해 약 1,144개에서 511,959개 문서까지 28개 중첩 tier를 만들고, 같은 reader·judge·질문을 유지하며 정확도, 구축·질의 토큰, 지연을 측정합니다.
왜 추천하나
RAG 설계에서 더 복잡한 검색기가 항상 낫다는 가정을 규모와 비용 축에서 검증합니다. 핵심 교훈은 에이전트를 버리라는 것이 아니라, 전역 후보 랭킹과 에이전트 추론의 책임을 분리하라는 것입니다. 대규모 문서 저장소를 운영하는 데이터 엔지니어에게 인덱스 구축 비용과 검색 품질을 함께 보는 좋은 실험 설계입니다.
핵심 결과
- 약 1,000만 corpus token 부근에서 BM25가 파일 시스템 에이전트를 앞서기 시작했고, 전체 규모의 공식 combined score는 BM25 50.5, 파일 에이전트 30.7, dense RAG 29.9였습니다.
- 파일 에이전트는 작은 bedrock에서 BM25와 비슷했지만 전체 규모에서 gold 문서를 하나라도 찾는 비율이 39.0%로 떨어졌습니다. 같은 에이전트에 BM25 검색을 제공하자 matched 150문항에서 점수가 36.9에서 69.4로 올랐고, 질의 토큰도 895K에서 101K로 줄었습니다.
- graph RAG의 병목은 추론 이전의 구축 단계였습니다. 일부 방식은 전체 corpus의 초기 일부에서 멈췄고, 측정된 성장률을 전체 규모로 외삽하면 수십억에서 1,020억 생성 토큰이 필요한 경우도 있었습니다.
한계와 읽을 때의 주의점
- 결과는 관련·교란 문서를 고정한 통제된 기업형 corpus와 하나의 reader 모델에 대한 것입니다. 관계 중심 질의나 다른 언어·도메인·chunking에서는 graph 또는 dense retrieval의 상대 순위가 달라질 수 있습니다.
- 주 실험은 시스템별 질문당 한 번 실행하고 불확실성을 질문 재표집으로 계산했습니다. 독립 judge가 판정의 96.2%에 동의했지만, 에이전트 실행 자체의 확률적 변동을 반복 실행으로 측정한 설계는 아닙니다.
원문과 프로젝트 자료
다이제스트 원칙
추천 이유는 논문이 직접 입증한 결과와 구분해 작성합니다. 수치, 데이터셋, 실험 조건은 확인할 수 있을 때만 포함하고, 공개된 평가 범위를 넘어서는 일반화는 피합니다.