Files
Liti-agent-Development/Case_02_Comparison_Research/판결문보고서작성_LLM_구상/deep-research-report.md
T
jhogyuandClaude Fable 5 3d8d90dcdb chore: sync working tree — Stage 1 v.7 reorg, jikji indexes, claim-drafting docs
- Rename "Claude YAML"/"Codex YAML" folders to Claude_YAML/Codex_YAML in Stage_1 v.7
- Add Stage_1 v.7 extension research, results runs, and reference material
- Add/refresh .jikji search indexes (Case_02 and Default_Agent corpora)
- Add per-case-type claim drafting folders and PDFs (청구취지기재방법)
- Add 판례모음 crawling data (08_14, 08_18)

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-08-19 14:07:35 +09:00

32 KiB
Raw Blame History

대한민국 법원 판결문 구조화·요약을 위한 LLM 선정 심층 보고서

집행 요약

대한민국 법원 판결문을 요건사실 단위의 구조화와 스키마 준수형 요약이라는 목적에 맞추어, 정확도와 비용을 함께 최적화하려면, 단일 승자 모델보다 역할 분담형 스택이 가장 효율적이다. 본 보고서의 결론은 다음과 같다. 기본 운영 모델로는 Gemini 2.5 Flash가 가장 균형적이다. 이유는 1M 컨텍스트, JSON 스키마 기반 구조화 출력, 배치 API 50% 할인, 캐싱, 매우 빠른 응답 속도, 그리고 비교적 낮은 토큰 단가가 동시에 성립하기 때문이다. 최고 정확도 보정 모델로는 Claude Sonnet 5가 가장 유력하다. 다만 Anthropic은 Sonnet 5의 새 토크나이저가 동일 텍스트를 약 30% 더 많은 토큰으로 계산한다고 명시하고 있어, 한국어 법률문서처럼 장문 입력에서는 체감 비용이 명시 요금표보다 더 빠르게 상승한다. 한국어 법률 용어와 국내 배포 통제가 더 중요하면 Solar Pro 3 또는 HCX-007이 강한 대안이다. 반면 완전 자가호스팅이 필요하면 EXAONE 4.0 32B와 Qwen3-32B 계열이 현실적인 출발점이다. citeturn25search3turn24view2turn24view3turn19view0turn22view3turn21view1turn29view0turn8view0turn35view4turn37search0

정확도 우선순위를 사용자가 제시한 순서대로 다시 정리하면, 이 문제는 일반적인 “요약 성능” 문제가 아니라 세분화된 추출·정규화 문제다. 즉 가장 중요한 것은 자유서술형 문장 품질이 아니라 요건사실 단위 요소의 누락·혼동 최소화, 그 다음이 정해진 JSON 스키마에 대한 강한 준수, 마지막이 한국 법률 용어의 자연스러운 처리다. 공개 근거를 종합하면, 스키마 준수 측면에서는 OpenAI와 Anthropic이 가장 강하게 보장적이며, Google도 JSON Schema 기반 구조화 출력을 공식 지원한다. NAVER HCX-007도 Structured Outputs를 공식 지원하고, Upstage Solar Pro는 사용자 정의 스키마에 대한 엄격한 준수를 전면적으로 내세운다. 따라서 스키마 신뢰성만 놓고 보면 OpenAI·Anthropic·Google·HCX-007·Solar Pro 모두 후보권이다. 성패를 가르는 진짜 차이는 한국어 법률 문맥과 비용 구조다. citeturn11search11turn11search12turn12search0turn12search14turn13search3turn13search7turn29view0turn30search0turn32search1

실무 권고는 세 갈래다. 하나의 API 모델만 써야 한다면 Gemini 2.5 Flash가 가장 무난한 최적점이다. 정확도를 끝까지 밀어붙이는 2단 구조라면 Gemini 2.5 Flash 또는 Solar Pro 3를 1차 추출기로 두고, Claude Sonnet 5를 저신뢰 케이스에만 선택적으로 호출하는 방식이 총비용 대비 성능이 가장 좋다. 국내 데이터 통제와 소버린 AI 요구가 강하면 HCX-007 또는 HyperCLOVA X 계열을 중심으로 두고, 긴 사건이나 복잡한 쟁점만 외부 프런티어 모델로 우회하는 구성이 적절하다. KBL 연구는 GPT-4와 Claude 계열이 당시 strongest open-source보다 한국 법률 지식·추론·변호사시험 성능에서 우월했지만, 동시에 단순 RAG만으로도 일부 점수가 개선된다고 보고했다. 또한 LBOX OPEN은 한국 법률 판결 요약과 장문 입력 평가가 가능하다는 점에서 이 문제에 가장 가까운 공개 기반이다. 즉, 프런티어 모델 우위는 여전히 유효하되, 검색·스키마·검증 설계를 함께 넣어야 실제 정확도 이득이 크다는 것이 문헌상 일관된 메시지다. citeturn39view0turn40view1turn40view3turn16search0turn16search5

비교 대상 모델과 선정 기준

본 업무는 Weaviate가 이미 판결문을 보관하고 있고, 한 요청마다 타깃 사건과 함께 2–3개의 전체 판결문 JSON이 반환된다는 점에서, 모델의 핵심 요구조건은 다음과 같이 압축된다. 첫째, 실질 컨텍스트 여유가 있어야 한다. 둘째, 구조화 출력의 강제력이 있어야 한다. 셋째, 한국어 법률 용어의 해상도가 높아야 한다. 넷째, 입력 반복부에 대한 캐싱 또는 배치 할인이 있어야 한다. 이 네 요소를 동시에 만족하는 후보군은 상용 프런티어 모델에서는 OpenAI GPT-4.1/GPT-5.4 mini, Anthropic Claude Sonnet 5, Google Gemini 2.5 Flash/Pro, 국내 모델에서는 NAVER HCX-007, Upstage Solar Pro 3, 오픈웨이트에서는 EXAONE 4.0 32B, Qwen3-32B, HyperCLOVA X SEED Think 14B 정도로 압축된다. citeturn23search3turn23search0turn22view3turn25search3turn27search0turn29view0turn33search1turn35view4turn37search0turn35view3

상용 모델의 사양은 비교적 명확하다. OpenAI의 GPT-4.1 mini는 1M 컨텍스트, 낮은 지연, 구조화 출력 지원, 그리고 입력 $0.40·출력 $1.60/백만 토큰으로 고정형 추출 업무에 매우 적합하다. GPT-5.4 mini는 400k 컨텍스트와 128k 출력, reasoning effort 제어를 제공하지만 단가는 GPT-4.1 mini보다 높다. Anthropic Claude Sonnet 5는 1M 컨텍스트와 128k 출력, 구조화 출력, 프롬프트 캐싱, 메시지 배치 API를 제공하며, “속도와 지능의 최적 조합”으로 포지셔닝되어 있다. Google Gemini 2.5 Flash와 Pro는 모두 1,048,576 입력 토큰과 65,536 출력 토큰, 구조화 출력, 배치, 캐싱, 튜닝을 지원한다. Flash는 가격과 속도에서, Pro는 복잡 추론에서 강하다. citeturn23search3turn23search5turn23search0turn22view3turn21view1turn25search3turn27search0turn26search1turn24view2turn24view3

국내·한국어 특화 후보는 다른 의미에서 강하다. NAVER의 CLOVA Studio 모델 문서는 HCX-007이 128k 컨텍스트, 32,768 출력 토큰, function calling, structured outputs, thinking을 지원한다고 명시한다. 또한 HyperCLOVA X는 한국 문화와 맥락을 가장 잘 이해하는 방향으로 설계되었다고 공식 문서에서 강조한다. 별도의 기술 블로그에서는 HyperCLOVA X THINK가 128k 컨텍스트와 6조 토큰 규모의 한·영 데이터로 훈련되었고, 한국 특화 벤치마크에서 Qwen3-14B, Qwen3-32B, EXAONE-Deep-32B 등을 앞섰다고 주장한다. Upstage는 Solar Pro 3를 총 102B·활성 12B의 MoE 모델로 소개하며, Solar Pro 2와 동일한 인터페이스·throughput·serving behavior를 유지한다고 설명한다. Solar Pro 2/3 관련 블로그는 특히 한국어와 문서형 작업에서 토큰 절감과 서비스 효율을 강조한다. citeturn29view0turn35view2turn33search1turn33search0turn33search2

오픈웨이트 후보 중에서는 EXAONE 4.0 32B가 가장 현실적인 한국어 자가호스팅 대안이다. Hugging Face 공식 카드에 따르면 131,072 컨텍스트를 제공하며, reasoning/non-reasoning 하이브리드 모드를 지원한다. 또한 EXAONE 4.0은 KMMLU-Pro, KMMLU-Redux, Ko-LongBench 등 한국어·장문 관련 지표를 전면에 내세운다. Qwen3-32B는 32,768 네이티브 컨텍스트와 YaRN 기반 131,072 검증 컨텍스트를 제공하고, Qwen 전체 계열은 약 36조 토큰, 119개 언어·방언 학습을 강조한다. Llama 4 Scout/Maverick는 장문 처리와 전반적 성능이 강하지만, 한국 법률 용어와 판결문 구조라는 특정 목적에서는 EXAONE과 HyperCLOVA 계열보다 우선순위가 낮다. citeturn36view0turn36view2turn37search0turn37search2turn35view1

아래 표는 법원 판결문 구조화 업무 관점에서 바로 필요한 항목만 압축한 것이다.

모델 컨텍스트 구조화 출력 배치/캐싱 한국어·법률 적합성 신호 파인튜닝·자가호스팅 판정
Gemini 2.5 Flash 1,048,576 / 65,536 JSON Schema 지원 배치 50%, 캐싱 지원 범용 강자, 한국어 특화는 아님 튜닝 지원, 자가호스팅 불가 기본 운영 추천
Claude Sonnet 5 1M / 128k 구조화 출력 보장 프롬프트 캐싱, 배치 API 당시 한국 법률 벤치마크 계열에서 프런티어 강세, 다만 토큰 30% 증가 주의 공개 FT 제한적 고정밀 fallback 추천
GPT-4.1 mini 1M / 모델별 출력 제한 Structured Outputs 강함 자동 캐싱, Batch 50% 범용 추출·툴콜 강함 FT 플랫폼 축소 추세 저비용 보정용 추천
HCX-007 128k / 32,768 지원 공개 배치 할인 확인 어려움, TPM 제한 명확 한국 문화·맥락/법률 용어 강점, 소버린 옵션 강함 튜닝 미지원, Neurocloud 온프렘 가능 국내용·통제중시 추천
Solar Pro 3 공개 가능한 공식 문서에서 컨텍스트 재확인 필요 지원 캐시 입력 단가 존재 한국어·문서형 효율 강점 자가호스팅/어댑터 공개 문서 부족 한국어 중심 API 추천
EXAONE 4.0 32B 131,072 프롬프트 기반 자체 서빙 설계 필요 한국어·장문 성능 강점 자가호스팅 가능 최상위 자가호스팅 추천
Qwen3-32B 32,768 native, 131,072 with YaRN 프롬프트 기반 자체 서빙 설계 필요 다국어 강점, 한국 법률 특화는 약함 자가호스팅 가능 비용형 자가호스팅 후보

표의 정량 사양은 OpenAI, Anthropic, Google, NAVER, Qwen, EXAONE의 공식 문서/모델 카드와 Upstage 공식 가격·블로그를 우선 사용했고, Solar Pro 3의 일부 세부 사양은 공개 접근 가능한 공식 페이지에서 완전 검증되지 않아 운영 전 콘솔 재확인을 권고한다. citeturn23search3turn23search0turn22view3turn21view1turn25search3turn27search0turn29view0turn8view0turn35view4turn36view0turn37search0turn33search1

경제성 분석과 건당 실제 비용 모델

이 워크플로우의 비용은 단순히 모델 단가만 보면 오도되기 쉽다. 실제 비용은 토크나이저가 한국어 판결문 JSON을 어떻게 자르는지, 고정 프롬프트가 얼마나 캐시되는지, 배치 할인과 캐싱이 중첩되는지, 긴 문장 때문에 고가 모델을 fallback으로 몇 %나 태우는지에 따라 달라진다. 본 보고서의 기준 시나리오는 다음과 같다. 기본 입력량은 “2.5개의 전체 판결문 JSON + 시스템 프롬프트 + 사용자 프롬프트 + JSON 스키마”로 보고, 범용 토크나이저 기준 입력 33,250 토큰, 출력 1,800 토큰을 사용했다. 이 중 2,000 토큰은 고정 prefix라서 캐시 대상이 된다. 이 수치는 직접 토크나이저로 전 모델을 측정한 값이 아니라 운영 설계용 기준 시나리오이며, 실제 구축 단계에서는 각 벤더 토큰 카운터로 반드시 재계산해야 한다. Anthropic은 Sonnet 5의 새 토크나이저가 동일 텍스트를 약 30% 더 많은 토큰으로 낼 수 있다고 명시했고, Upstage는 한국어·문서형 작업에서 2–30% 토큰 절감을, NAVER는 한국어 비최적화 토크나이저 대비 최대 절반 수준 토큰 사용 가능성을 주장한다. 그래서 본 보고서의 모델링에서는 Claude Sonnet 5는 ×1.30, Solar Pro 3는 ×0.85, HCX-007은 ×0.75의 토큰 보정계수를 적용했다. Solar와 HCX의 정확한 계수는 공개 정밀 계수표가 없으므로 보수적 중간값이며, 엄밀히 말하면 this is my inference without much evidence다. citeturn21view1turn33search0turn33search2turn3search7turn28search18

건당 비용 공식은 간단하다.
[ \text{Cost}_{case}

\frac{T_{in,nc}}{10^6}P_{in} + \frac{T_{in,cached}}{10^6}P_{cache} + \frac{T_{out}}{10^6}P_{out} ] 여기서 (T_{in,nc})는 비캐시 입력, (T_{in,cached})는 캐시 히트 입력, (P)는 각 단가다. OpenAI는 gpt-4o 이후 최신 모델에서 자동 프롬프트 캐싱을 지원하며, GPT-5.6 이후 계열은 캐시 write가 별도 과금되고, 이전 계열은 캐시 write 추가요금이 없다. OpenAI Batch API는 표준 API 대비 50% 비용이다. Google Gemini Batch API도 표준 대비 50% 비용이며, Agent Platform 문서상 캐시 할인과 배치 할인은 중첩되지 않고 더 큰 캐시 할인 쪽이 우선한다. Anthropic은 prompt caching과 Message Batches가 함께 작동하고 할인 효과가 중첩될 수 있다고 설명한다. citeturn43view0turn42view0turn11search3turn24view3turn13search4turn12search1turn12search4

본 기준 시나리오에 따라 계산한 건당 추정 API 비용은 아래와 같다. HCX-007 가격은 공식 상품 페이지 텍스트 파싱이 어려워, NAVER Cloud 가격 검색 스니펫 및 보도에 노출된 수치를 사용했으므로 계약 전 재확인이 필요하다. Solar Pro 3은 공식 가격 페이지가 확인되었다. Gemini Pro는 200k 이하 프롬프트 구간 요율을 사용했다. Claude Sonnet 5는 문서에 명시된 2026년 8월 31일까지 적용되는 도입 가격을 사용했다. citeturn42view0turn24view0turn21view1turn8view0turn6search6

모델 입력·출력 단가 캐시 단가 기준 시나리오 건당 비용 배치 적용 시 건당 비용
HCX-007 약 $0.091 / $0.362 per MTok 환산 공개 확인 곤란 $0.0027 공개 할인 미확인
Solar Pro 3 $0.15 / $0.60 $0.015 $0.0049 공개 할인 미확인
Gemini 2.5 Flash-Lite $0.15 / $1.25 별도 캐시 모델 $0.0072 $0.0036
Gemini 2.5 Flash $0.30 / $2.50 별도 캐시 모델 $0.0145 $0.0072
GPT-4.1 mini $0.40 / $1.60 $0.10 $0.0156 $0.0078
GPT-5.4 mini $0.75 / $4.50 $0.075 $0.0317 $0.0158
GPT-4.1 $2.00 / $8.00 $0.50 $0.0779 $0.0390
Claude Sonnet 5 $2.00 / $10.00 $0.20 $0.1052 수치형 배치 할인은 본 보고서에서 미산정
Gemini 2.5 Pro $2.25 / $18.00 별도 캐시 모델 $0.1072 $0.0536

이 숫자가 말하는 바는 분명하다. 판결문 구조화는 생각보다 아주 싼 작업이다. 문제는 건당 비용이 아니라 10만 건 규모로 확대될 때의 누적액과 fallback 비율이다. 예를 들어 Gemini 2.5 Flash를 기본으로 쓰면 1만 건은 대략 $145 수준이고, 같은 물량을 Gemini 2.5 Pro로 올리면 $1,072 수준으로 뛴다. Claude Sonnet 5는 한국어 장문에서 토큰이 더 늘 수 있으므로 실제 총액이 더 커질 수 있다. 반면 Solar Pro 3와 HCX-007은 입력비가 매우 낮아 대량 백필(backfill) 작업에 특히 유리하다. 따라서 “모든 사건을 가장 똑똑한 모델 하나로 처리”하는 전략은 경제적으로 비효율적이고, 기본모델 + 선택적 고정밀 fallback이 정답에 가깝다. citeturn42view0turn24view0turn21view1turn33search1turn8view0

이 그림은 위 가정에 기초한 추정 건당 비용과 예상 요건사실 F1의 상대 위치를 시각화한 것이다. 비용은 공식 가격표와 위 토큰 가정을 결합한 값이고, 정확도는 뒤 절에서 설명할 proxy benchmark 기반 사전 추정치다.

비용 대 정확도 추정 산점도

운영 속도도 무시할 수 없다. 공개 성능 측정치가 있는 모델만 놓고 보면 Gemini 2.5 Flash-Lite와 Flash가 가장 빠르며, Gemini Pro는 추론 품질은 높지만 초기 지연이 훨씬 길다. GPT-4.1 mini는 비용은 낮지만 직렬 처리 속도는 Gemini Flash보다 느리다. 아래 차트는 공개 TTFT와 output speed를 이용해 1개의 직렬 워커가 시간당 처리할 수 있는 사건 수를 가늠한 것이다. Anthropic Sonnet 5는 output-effort 설정에 따라 변동 폭이 크므로 운영 전 자체 실측이 반드시 필요하다. citeturn19view0turn20search4turn20search2turn20search10turn20search5turn20search13

직렬 처리 기준 추정 처리량

정확도 기대치와 평가셋 설계

직접적인 “대한민국 판결문 → 요건사실 JSON” 공개 벤치마크는 아직 성숙하지 않다. 그래서 본 보고서는 LBOX OPEN의 판결 요약·장문 기반, KBL의 한국 법률 이해 벤치마크, KCL의 reasoning benchmark, 그리고 각 모델의 한국어·구조화 출력 기능 스펙을 조합해 사전 기대치를 제시한다. LBOX OPEN은 147k 한국 판례 코퍼스와 20k 요약 태스크, 그리고 51k 장문 요약 변형을 포함한다. KBL은 7개 지식 태스크, 4개 추론 태스크, 한국 변호사시험 2,510 예시를 포함하며, GPT-4와 Claude 계열조차 한국 법률 과제에서는 여전히 개선 여지가 크다고 보고한다. KCL은 supporting precedent가 달린 한국 canonical legal reasoning benchmark다. 즉, 이 문제는 지금도 frontier capability가 필요하지만, 동시에 한국 법률 구조 자체가 별도 평가셋을 강하게 요구하는 영역이다. citeturn16search0turn38search6turn39view0turn38search4

권장 평가셋은 사용자가 허용한 가정대로 100건의 대표 판결문을 새로 구성하는 방식이 가장 타당하다. 사건 구성을 민사 일반 20, 형사 15, 상사·회사 15, 노동 15, 행정·조세 15, 가사 10, 지식재산 10으로 두고, 심급 구성은 1심 45, 항소심 35, 대법원 20이 적절하다. 그 이유는 대법원 판결은 법리축이 선명하지만 사실서술이 상대적으로 압축되고, 1·2심은 요건사실 단위의 사실인정과 증거판단이 풍부하여 추출 난도가 높기 때문이다. 데이터 원천은 법제처 판례 API, 대한민국 법원 판결서 인터넷열람/종합법률정보, 그리고 공개 활용이 가능한 LBOX OPEN 계열을 혼합하되, 개인정보 비식별과 라이선스 조건을 철저히 검토해야 한다. 대한민국 법원과 법제처는 판례·판결문 접근 경로를 제공하지만 범위와 형식이 제한되어 있으므로, 실제 운영용 코퍼스와 평가용 코퍼스를 별도로 관리하는 편이 안전하다. citeturn16search2turn17search0turn17search1turn17search9turn17search13turn16search12

어노테이션 단위는 반드시 요건사실 단위로 쪼개야 한다. 최소 스키마는 다음 열을 포함해야 한다. party_roles, claims, defenses, issues, fact_units, legal_elements, court_holdings, evidence_or_reasoning_basis, outcome, remedies_or_sentence, cited_statutes, cited_precedents. 여기서 핵심 필드는 fact_units와 legal_elements의 연결이다. 즉, “어떤 사실이 어떤 법적 요소를 지지·배척했는지”를 엣지 단위로 남겨야 나중에 precision/recall/F1가 의미를 가진다. 이 설계는 LegalBench류 영어 법률 벤치마크가 IRAC 유형별 과제를 분리한 방식과도 조응하고, KBL이 실제 법률가 시나리오를 반영하려 한 취지와도 맞닿아 있다. citeturn39view0turn38search17

평가 지표는 다음처럼 설계하는 것이 좋다. 주지표는 element-level micro/macro precision, recall, F1이다. legal_elements를 gold set과 예측 set으로 보고, supporting_fact_unit_ids까지 맞으면 exact match, 요소는 맞고 fact linkage가 빠지면 partial credit을 준다. 스키마 지표는 (JSON valid 여부, required field 존재율, type correctness, enum adherence)를 합성한 Schema Adherence Score로 만들고, 운영상으로는 “유효 JSON 비율”과 “후처리 없이 DB 적재 가능한 비율”을 따로 기록하는 편이 더 유익하다. 용어 정확도는 대표 법률용어 300개 안팎의 표준 표기 사전을 두고, 정확·허용·오류의 3단계로 변호사 검수를 붙이는 방식이 적합하다. 지연·처리량·비용은 반드시 함께 측정해야 한다. 왜냐하면 법률 구조화 업무는 정답 하나의 품질보다 정답률 × 사건당 비용 × 월간 물량이 실제 의사결정 변수이기 때문이다. citeturn11search12turn12search0turn24view2turn30search0

사전 기대 정확도는 아래처럼 보는 것이 가장 현실적이다. 직접 100건 평가셋에서 실측한 수치가 아니므로, 이 표는 proxy benchmark + 기능 스펙 + 한국어 특화 신호를 결합한 사전 전망표다. 엄밀하게는 일부 구간이 “this is my inference without much evidence”에 해당한다. 그 점을 전제로 보면, 요건사실 F1은 Claude Sonnet 5가 가장 높고, 그 다음이 Gemini 2.5 Pro와 GPT-4.1/GPT-5.4 mini, 그 뒤를 Gemini 2.5 Flash·Solar Pro 3·HCX-007이 따르는 구도가 가장 개연적이다. 다만 한국 법률 용어 정확도만 따로 보면 HCX-007·Solar Pro 3·HyperCLOVA X THINK·EXAONE 4.0이 상향 조정될 여지가 있다. 100건 평가셋의 95% 신뢰구간은 사건 단위 bootstrap 10,000회로 계산하고, 모델 비교는 paired bootstrap 또는 McNemar류 검정을 병행하는 것이 적절하다. KBL이 변호사 검증형 한국 법률 태스크를 별도로 설계한 이유 자체가, 이 영역에서는 일반 벤치마크 전이만으로 모델 선택이 어렵기 때문이다. citeturn39view0turn40view1turn35view2turn35view3turn36view2

모델군 예상 요건사실 F1 예상 스키마 준수 예상 용어 정확도 신뢰도 코멘트
Claude Sonnet 5 0.89–0.92 0.98–1.00 0.87–0.90 구조화·장문·추론이 강하나 비용 높음
Gemini 2.5 Pro 0.88–0.91 0.97–0.99 0.86–0.89 reasoning 우수, 지연 큼
GPT-4.1 / GPT-5.4 mini 0.87–0.90 0.99–1.00 0.85–0.88 schema 강점, 법률 한국어는 보정 필요
Gemini 2.5 Flash 0.85–0.89 0.96–0.99 0.84–0.87 기본 운영 최적점
Solar Pro 3 0.84–0.88 0.95–0.99 0.88–0.91 한국어 문맥 이점 기대, 공식 공개 벤치 제한
HCX-007 0.84–0.88 0.94–0.98 0.89–0.92 소버린·국내 법률 용어 강점 기대
EXAONE 4.0 32B 0.80–0.85 0.88–0.95 0.85–0.89 자가호스팅 최상위권
Qwen3-32B 0.78–0.83 0.87–0.94 0.80–0.85 비용형 자가호스팅 후보

권고안과 배포 구성

가장 추천하는 실전 구성은 Gemini 2.5 Flash 주모델 + Claude Sonnet 5 선택적 fallback이다. 이유는 단순하다. Gemini 2.5 Flash는 1M 컨텍스트를 공식 지원하고, 구조화 출력, 배치 50%, 캐싱, 매우 빠른 응답 속도를 동시에 제공한다. 이 덕분에 Weaviate가 반환한 2–3개의 전체 판결문 JSON을 거의 전처리 없이 바로 읽히는 경우가 많다. 반면 fallback으로 Sonnet 5를 두면, 법리가 복잡하거나 사실관계가 충돌하는 사건에서 element-level recall을 끌어올릴 가능성이 높다. 특히 모델 자체 confidence, schema validator 경고, gold-like heuristic를 이용해 “재심사 대상”만 Sonnet 5로 보내면 정확도 향상은 유지하면서 비용 급증을 피할 수 있다. citeturn25search3turn27search0turn24view3turn22view3turn12search0turn12search1

한국어 특화 관점에서는 Solar Pro 3 주모델 + GPT-4.1 mini 스키마 복구기 조합도 매우 경쟁력 있다. Solar Pro 3는 가격이 극단적으로 낮고, Upstage는 Korean/document-heavy 작업에서 토큰 절감을 공개적으로 강조한다. 또한 Solar Pro는 structured outputs를 핵심 capability로 내세운다. 다만 공개 접근 가능한 공식 자료만으로는 Pro 3의 세부 컨텍스트 사양을 완전히 확인하기 어렵고, 내부 벤치마크 중심의 주장이 많아 반드시 직접 100건 셋으로 검증한 뒤 채택해야 한다. 반대로 GPT-4.1 mini는 툴콜과 instruction following이 강하고, 구조화 출력 성공률이 높아 “추출 본문”보다 “repair and normalize” 역할에 적합하다. 이 조합은 한국어 용어 처리와 스키마 정확성을 분업한다는 점이 장점이다. citeturn33search1turn32search1turn23search3turn11search12

소버린 요건과 내부망 배포가 강하면 HCX-007 중심 구조가 가장 합리적이다. CLOVA Studio 문서는 HCX-007이 structured outputs와 thinking을 지원하고, 128k 컨텍스트와 32,768 출력 토큰을 제공한다고 밝힌다. NAVER Cloud의 Neurocloud 문서는 HyperCLOVA X 기반 CLOVA Studio를 온프레미스/하이브리드 구조와 연결할 수 있고, 고객 데이터가 사내 처리·저장되도록 해 규제 준수에 유리하다고 설명한다. 단점은 공개적이고 완전한 가격·배치 할인·세부 latency 자료가 상대적으로 부족하다는 점이다. 따라서 HCX-007은 규제·국내 데이터 통제 점수가 매우 높을 때, 즉 “최저 비용”이나 “절대 최고 정확도”보다 통제 가능성이 더 중요한 조직에 적합하다. citeturn29view0turn29view2turn31view3

자가호스팅이 필요하면 EXAONE 4.0 32B를 1순위로 권한다. Qwen3-32B도 충분히 강하지만, 한국어 장문·전문용어 환경에서는 EXAONE 4.0이 더 자연스러운 출발점이다. EXAONE 4.0 모델 카드는 131,072 토큰 컨텍스트와 hybrid reasoning capability를 보여 주며, 한국어 벤치마크를 다수 포함한다. Qwen3-32B는 광범위한 다국어 토대를 제공하고 YaRN으로 131,072까지 확장 검증이 되었으므로, GPU·서빙 스택이 이미 Qwen 친화적이면 대안이 된다. 다만 자가호스팅의 핵심은 기본모델 선택보다 LoRA/adapter 학습과 schema validator 결합이다. 즉, 100건 gold set으로 instruction tuning을 한 뒤, 출력 JSON validator와 규칙기반 post-check를 반드시 붙여야 실무 정확도가 올라간다. citeturn36view0turn36view2turn37search0turn37search2

권고 아키텍처는 아래와 같다.

flowchart LR
    A[Weaviate 검색\n타깃 판결문 + 유사 판결 2~3건 JSON] --> B[Input normalizer\n불필요 메타 제거·길이 점검]
    B --> C[Primary LLM\nGemini 2.5 Flash 또는 Solar Pro 3 또는 HCX-007]
    C --> D[JSON Schema validator]
    D -->|통과| E[Structured summary report]
    D -->|실패 또는 낮은 신뢰도| F[Repair/Fallback LLM\nGPT-4.1 mini 또는 Claude Sonnet 5]
    F --> G[법률 용어/필드 consistency check]
    G --> E

프롬프트 설계는 가능하면 두 단계 지시문으로 고정해야 한다. 첫 단계는 “당신은 판결문을 논평하지 말고, 오직 법적 요소를 스키마에 채워라”는 역할 정의다. 둘째 단계는 “사실 단위와 법적 요소를 연결하라”는 출력 제약이다. 구조화 출력 기능이 있는 모델에서는 자유 텍스트를 허용하지 않고, JSON Schema를 API 레벨에서 함께 전달하는 편이 훨씬 낫다. OpenAI·Anthropic·Google·HCX·Solar 모두 이 방향이 가능하다. citeturn11search12turn12search0turn24view2turn30search0turn32search1

아래는 권장 시스템 프롬프트의 골격이다.

당신의 임무는 대한민국 법원 판결문을 '요건사실 단위'로 분해하여,
주어진 JSON Schema에 정확히 맞는 구조화 결과만 출력하는 것이다.

반드시 지켜야 할 규칙:
1. 추정하지 말고, 판결문에 근거가 없는 내용은 null 또는 []로 둔다.
2. 각 legal_element에는 supporting_fact_unit_ids를 연결한다.
3. 판결 이유와 주문을 혼동하지 않는다.
4. 법조문, 판례번호, 손해배상액/형량 등은 원문 표기를 우선한다.
5. 설명 문장은 금지한다. 오직 JSON만 출력한다.
6. 용어는 대한민국 법률 실무 표현을 우선한다.
7. 타깃 사건과 참고 사건을 구분하고, 참고 사건은 비교·보조 근거로만 사용한다.

그리고 사용자 프롬프트는 다음처럼 짧고 기계적으로 유지하는 편이 캐싱과 일관성에 유리하다.

타깃 판결문 JSON과 참고 판결문 JSON들을 읽고,
다음 스키마에 맞추어 structured summary report를 출력하라.
핵심 평가지표는 요건사실 추출 정확성, 스키마 준수, 법률 용어 정확성이다.

[SCHEMA]
{...}

[TARGET]
{target_judgment_json}

[REFERENCES]
{retrieved_reference_jsons}

평가 프로토콜과 구현 로드맵

평가 절차는 반드시 오프라인 벤치마크 → 프롬프트 고정 → 비용 실측 → shadow deployment → 점진 전환 순서로 가야 한다. 법률 업무에서 가장 흔한 실패는 “좋아 보이는 데모 프롬프트”를 바로 생산에 넣는 것이다. KBL과 LBOX OPEN이 시사하는 바도 같다. 즉, 한국 법률은 영어 법률 벤치마크나 일반 한국어 벤치마크와 다른 독자적 실패 패턴을 가진다. 그러므로 모델 비교는 최소한 동일 schema, 동일 target/reference 세트, 동일 max output, 동일 post-validator 아래에서 해야 한다. citeturn39view0turn16search0

실험 프로토콜은 다음을 권한다. 각 100개 사건에 대해 모델별로 3회 반복 실행을 수행하고, 온도는 0 또는 0.1로 고정한다. 주지표는 micro-F1 on legal elements, 보조지표는 schema validity, field completeness, term accuracy, latency, cost다. Reference judgment를 0개, 2개, 3개로 나눈 ablation을 반드시 시행해야 한다. 왜냐하면 사용자의 현재 파이프라인은 Weaviate가 2–3개의 전체 JSON을 반환하도록 되어 있고, 이 설정이 실제로 recall을 올리는지 아니면 distractor만 늘리는지 확인해야 하기 때문이다. KBL에서도 단순 BM25 기반 외부 문서 추가가 경우에 따라 성능을 올렸지만, 코퍼스 종류와 모델에 따라 개선 폭이 달랐다. citeturn39view0turn40view0turn40view3

구현 일정은 보통 6주에서 8주가 현실적이다. 첫 2주는 데이터 수집과 정답 스키마 정립, 다음 2주는 모델 벤치마크와 프롬프트 고정, 마지막 2주 내지 4주는 shadow deployment와 rule-based validator 정교화에 쓰는 편이 안전하다. 특히 법률 요약 시스템은 모델 바꾸는 비용보다 annotation guideline을 뒤늦게 고치는 비용이 훨씬 크다. 따라서 초기에 변호사·연구자 합동으로 gold spec을 굳히는 것이 가장 중요하다. 이 부분은 공개 문헌에서 직접 주어진 숫자가 아니라 실무형 추산이다. citeturn39view0turn16search0

gantt
    title 판결문 구조화 시스템 구축 권장 일정
    dateFormat  YYYY-MM-DD
    axisFormat  %m/%d
    section 데이터
    표본 100건 선정 및 라이선스 검토      :a1, 2026-07-15, 10d
    어노테이션 가이드 고정                 :a2, after a1, 6d
    section 평가
    모델별 오프라인 벤치마크               :b1, after a2, 10d
    프롬프트/스키마/validator 고정         :b2, after b1, 7d
    section 배포
    Shadow deployment                     :c1, after b2, 10d
    선택적 fallback 규칙 최적화            :c2, after c1, 7d
    운영 전환                              :c3, after c2, 5d

최종적으로, 사용자가 지금 바로 의사결정을 내려야 한다면 다음처럼 정리할 수 있다. 하나만 고르라면 Gemini 2.5 Flash, 가장 똑똑한 보정모델까지 포함하면 Gemini 2.5 Flash + Claude Sonnet 5, 한국어·국내 통제·초저비용이면 Solar Pro 3 또는 HCX-007, 완전 자가호스팅이면 EXAONE 4.0 32B가 각각 최적점이다. 다만 실제 발주나 시스템 도입의 기준선은 이론적 평판이 아니라, 반드시 100건 한국 판결문 gold set에서의 element-level F1, schema validity, term accuracy, and per-case cost여야 한다. 이 기준으로 보면, 본 과업의 “가장 효율적인 모델”은 단일 모델명이 아니라 상황별로 분리된 역할 중심 조합이다. citeturn25search3turn22view3turn29view0turn33search1turn36view0