내 문서가 AI에 들어갈까 — 한국어 문서 종류별 토큰 기준표
“이 문서를 AI에 통째로 넣어도 될까?” — 긴 파일을 다룰 때마다 걸리는 문제입니다. 컨텍스트 한도는 토큰으로 표시되는데, 내 문서가 몇 토큰인지는 감이 안 옵니다.
그래서 실무에서 자주 다루는 한국어 문서 7종을 직접 작성해 측정하고, 바로 찾아볼 수 있는 기준표로 만들었습니다.
문서 종류별 실측 결과
| 문서 종류 | 글자 수 | 토큰 | 글자당 토큰 |
|---|---|---|---|
| 업무 이메일 | 162자 | 88 | 0.543 |
| 뉴스 기사 (짧은 기사) | 262자 | 141 | 0.538 (가장 효율적) |
| 이력서 (1페이지) | 319자 | 174 | 0.545 |
| 논문 초록 | 308자 | 174 | 0.565 |
| 회의록 | 332자 | 205 | 0.617 |
| 블로그 글 | 433자 | 268 | 0.619 |
| 계약서 조항 | 304자 | 190 | 0.625 (가장 비효율) |
| 평균 | 0.579 |
문서마다 글자당 토큰이 다릅니다. 가장 비싼 계약서가 가장 싼 뉴스 기사보다 16% 더 듭니다. 같은 1,000자라도 문서 성격에 따라 실제 비용이 달라진다는 뜻입니다.
왜 계약서와 회의록이 비싼가
두 문서의 공통점은 숫자·날짜·기호가 많다는 것입니다. 앞선 측정에서 숫자와 날짜는 글자당 0.73토큰으로 일반 문장(0.47)보다 훨씬 비쌌습니다. 계약서는 여기에 한자어(“지연손해금”, “시정 요구”)까지 더해집니다.
반대로 뉴스 기사와 이메일은 평이한 서술문 위주라 토크나이저가 효율적으로 쪼갭니다.
컨텍스트 한도에 몇 개나 들어갈까
모델이 광고하는 컨텍스트 한도를 실제 문서 개수로 환산하면 이렇습니다.
| 문서 종류 | 8K 모델 | 128K 모델 | 1M 모델 |
|---|---|---|---|
| 업무 이메일 | 90개 | 1,454개 | 11,363개 |
| 뉴스 기사 | 56개 | 907개 | 7,092개 |
| 이력서 1장 | 45개 | 735개 | 5,747개 |
| 논문 초록 | 45개 | 735개 | 5,747개 |
| 계약서 조항 | 42개 | 673개 | 5,263개 |
| 회의록 | 39개 | 624개 | 4,878개 |
| 블로그 글 | 29개 | 477개 | 3,731개 |
주의할 점이 있습니다. 위 숫자는 입력만 계산한 것입니다. 실제로는 대화 기록과 AI의 답변도 같은 한도를 나눠 쓰므로, 여유를 두고 절반 정도로 잡는 것이 안전합니다.
실무 기준: 128K 컨텍스트라면 이력서 300~400장, 회의록 300건 정도까지가 현실적인 선입니다.
내 문서 토큰을 암산하는 법
정확히 재지 않아도 되는 상황에서는 이 기준으로 충분합니다.
| 문서 성격 | 곱하는 값 | 예: 2,000자면 |
|---|---|---|
| 평이한 글 (기사·이메일·설명문) | × 0.54 | 약 1,080 토큰 |
| 일반적인 문서 (평균) | × 0.58 | 약 1,160 토큰 |
| 숫자·기호 많은 문서 (계약서·회의록·표) | × 0.63 | 약 1,260 토큰 |
대략 글자 수의 60%라고 외워두면 대부분의 상황에서 맞습니다.
A4 기준으로는
| 분량 | 대략 글자 | 대략 토큰 |
|---|---|---|
| A4 1장 | 약 880자 | 약 510 토큰 |
| A4 10장 | 약 8,800자 | 약 5,100 토큰 |
| A4 100장 | 약 88,000자 | 약 51,000 토큰 |
| A4 250장 (책 1권 분량) | 약 220,000자 | 약 128,000 토큰 |
즉 128K 컨텍스트는 한국어로 책 한 권 분량입니다. 생각보다 넉넉합니다.
한도를 넘을 때 어떻게 자를까
문서가 한도를 넘으면 잘라서 넣어야 합니다. 이때 요령이 있습니다.
- 의미 단위로 자르세요. 글자 수로 기계적으로 자르면 문장 중간이 끊겨 이해도가 떨어집니다. 장·절·소제목 경계가 좋습니다.
- 각 조각에 맥락을 한 줄 붙이세요. “이것은 전체 계약서 중 제5조~제7조입니다” 같은 안내가 있으면 답변 품질이 달라집니다.
- 필요 없는 부분은 아예 빼세요. 가장 확실한 절약입니다. 목차·표지·반복되는 머리말은 대개 불필요합니다.
- 표는 CSV로 바꿔 넣으세요. 같은 데이터가 JSON보다 최대 2배 저렴합니다.
측정 방법과 재현
실무에서 흔히 쓰이는 형태로 직접 작성한 문서 표본 7종을 사용했습니다. 저작권 문제를 피하기 위해 실제 타인의 문서는 쓰지 않았습니다. 토크나이저는 tiktoken 0.14.0의 o200k_base(GPT-4o 이후 세대)입니다.
import tiktoken
enc = tiktoken.get_encoding("o200k_base")
text = open("내문서.txt", encoding="utf-8").read()
n = len(enc.encode(text))
print(f"{len(text)}자 / {n}토큰 / 글자당 {n/len(text):.3f}")이 코드로 내 실제 문서를 재보는 것이 가장 정확합니다. 위 기준표는 어림잡을 때 쓰시고, 비용이 중요한 작업이라면 직접 측정하세요.
한계: OpenAI 계열 토크나이저 기준입니다. 다른 회사 모델은 토크나이저가 달라 수치가 달라집니다. 경향(한국어가 더 비싸다, 숫자·기호가 비싸다)은 비슷하게 나타납니다.
정리
- 한국어 문서는 글자 수의 약 58%가 토큰입니다. 대략 60%로 외우면 됩니다.
- 계약서·회의록처럼 숫자와 기호가 많은 문서가 16% 더 비쌉니다.
- 128K 컨텍스트는 한국어로 A4 약 250장, 책 한 권 분량입니다.
- 답변과 대화 기록도 한도를 나눠 쓰므로 절반 정도로 여유를 두세요.
- 자를 때는 글자 수가 아니라 의미 단위로 자르고, 조각마다 맥락을 한 줄 붙이세요.
측정일: 2026년 9월 20일 / tiktoken 0.14.0 / 인코딩 o200k_base / 표본은 직접 작성