AI 대화가 길어지면 비용이 25배 — 누적 토큰 실측
AI와 대화를 이어가다 보면 어느 순간 답변이 느려지고, API를 쓰는 경우라면 요금이 예상보다 많이 나옵니다. 이유는 단순합니다. 대화는 매 턴마다 지금까지의 전체 내용을 다시 전송합니다.
이게 비용에 얼마나 영향을 주는지 직접 계산해봤습니다. 결론부터 말하면 20턴 대화는 25배입니다.
AI는 기억하지 않는다 — 매번 다시 읽는다
많은 분이 오해하는 지점입니다. AI가 앞의 대화를 “기억”하는 것처럼 보이지만, 실제로는 그렇지 않습니다. 매 요청마다 지금까지의 대화 전체를 처음부터 다시 읽습니다.
즉 10번째 질문을 하면, AI는 1~9번째 질문과 답변을 전부 다시 입력받은 뒤 10번째 질문에 답합니다. 그리고 그 전부가 입력 토큰으로 과금됩니다.
실측 — 턴이 쌓일수록
전형적인 대화를 가정하고 계산했습니다. 시스템 지시 34토큰, 사용자 질문 25토큰, AI 답변 124토큰 기준입니다.
| 턴 | 이번 턴 입력 토큰 | 누적 입력 토큰 | 1턴 대비 |
|---|---|---|---|
| 1턴 | 59 | 59 | 1배 |
| 2턴 | 208 | 267 | 4.5배 |
| 3턴 | 357 | 624 | 10.6배 |
| 5턴 | 655 | 1,785 | 30배 |
| 10턴 | 1,400 | 7,295 | 124배 |
| 15턴 | 2,145 | 16,530 | 280배 |
| 20턴 | 2,890 | 29,490 | 500배 |
주목할 것은 누적 열입니다. 20턴짜리 대화 하나를 끝내면 총 29,490 입력 토큰을 쓴 것입니다.
만약 매번 새 대화로 20개의 독립된 질문을 했다면 1,180 토큰이면 됐습니다. 25배 차이입니다.
대화가 길어지는 비용은 직선이 아니라 곡선으로 늘어납니다. 턴이 두 배면 비용은 네 배에 가깝습니다.
가장 비싼 실수 — 긴 문서를 넣고 계속 대화하기
실무에서 가장 흔하고 가장 비싼 패턴입니다. 계약서나 보고서를 첨부하고 그에 대해 계속 질문하는 경우입니다.
3,000토큰짜리 문서(한국어 약 5,600자, A4 6장 정도)를 첫 턴에 넣고 10턴 대화하면 이렇게 됩니다.
| 항목 | 토큰 |
|---|---|
| 전체 누적 입력 | 37,295 |
| 그중 문서 재전송분 | 30,000 (80%) |
| 실제 대화 내용 | 7,295 (20%) |
비용의 80%가 같은 문서를 10번 다시 보낸 값입니다. 문서는 첫 턴에 한 번 넣었을 뿐이지만, 이후 모든 턴에서 계속 따라다닙니다.
얼마나 자주 끊어야 하나 — 실측
40턴 분량의 작업을 할 때, 대화를 주기적으로 새로 시작하면 얼마나 절약되는지 계산했습니다.
| 방식 | 누적 입력 토큰 | 절감 |
|---|---|---|
| 끊지 않고 40턴 | 118,580 | 기준 |
| 20턴마다 새 대화 | 58,980 | 50% |
| 10턴마다 새 대화 | 29,180 | 75% |
| 5턴마다 새 대화 | 14,280 | 88% |
| 3턴마다 새 대화 | 8,171 | 93% |
10턴 정도에서 끊는 것만으로 75%가 절약됩니다. 물론 맥락이 끊기는 비용이 있으므로, 주제가 바뀌는 지점에서 끊는 것이 합리적입니다.
실무 적용
1. 주제가 바뀌면 새 대화를 시작하세요
가장 쉽고 효과가 큽니다. 이어서 물을 이유가 없는 질문을 같은 창에서 계속하면 앞의 대화 전부를 매번 재전송합니다. 맥락이 필요 없으면 새 창이 원칙입니다.
2. 문서는 필요한 부분만 잘라 넣으세요
문서 재전송이 비용의 대부분을 차지하므로, 넣는 분량을 줄이는 것이 가장 직접적입니다. 계약서 전체가 아니라 해당 조항만, 보고서 전체가 아니라 해당 장만 넣으세요.
3. 문서에 대한 질문은 한 번에 모아서 하세요
“이것도 알려줘”를 열 번 하는 대신, 궁금한 열 가지를 한 번에 목록으로 물으면 문서를 한 번만 전송합니다.
[비효율]
1턴: (문서 첨부) 요약해줘
2턴: 리스크는?
3턴: 기한은 언제야?
... => 문서가 매 턴 재전송
[효율]
1턴: (문서 첨부) 아래를 한 번에 정리해줘.
1) 3줄 요약
2) 나에게 불리한 조항
3) 내가 해야 할 일과 기한
4) 확인이 필요한 모호한 표현
=> 문서 1회 전송4. 긴 대화는 요약하고 새로 시작하세요
맥락을 유지해야 한다면, “지금까지 논의를 10줄로 요약해줘”를 요청한 뒤 그 요약만 들고 새 대화를 시작하세요. 수천 토큰짜리 대화 기록이 수백 토큰으로 줄어듭니다.
무료 서비스를 쓰는 경우에도 해당되나
요금이 직접 청구되지 않더라도 영향이 있습니다. 무료 요금제의 사용 한도는 대개 토큰이나 메시지 수로 계산되고, 긴 대화는 컨텍스트 한도에도 빠르게 도달합니다. 한도를 넘으면 앞부분 내용을 잊기 시작합니다.
즉 대화가 길어지면 비용뿐 아니라 품질도 떨어집니다. 끊어 쓰는 것이 양쪽 모두에 유리합니다.
계산 방법과 재현
실제 API 과금 방식(매 요청마다 전체 대화를 입력으로 전송)을 그대로 모사해 계산했습니다. 토크나이저는 tiktoken 0.14.0의 o200k_base입니다.
import tiktoken
enc = tiktoken.get_encoding("o200k_base")
n = lambda t: len(enc.encode(t))
system = n("너는 경영 컨설턴트야. 답변은 구체적인 예시를 들어서 설명해줘.")
user = n("이 부분을 좀 더 구체적으로 설명해줄 수 있을까요?")
assistant = n("네, 설명드리겠습니다. ... (실제 답변 길이)")
cum = 0
for turn in range(1, 21):
this_turn = system + (turn - 1) * (user + assistant) + user
cum += this_turn
print(turn, this_turn, cum)한계: 실제 서비스는 캐싱이나 요약을 적용하기도 하므로 청구액이 이 계산과 다를 수 있습니다. 다만 대화가 길어질수록 비용이 가파르게 는다는 구조는 동일합니다. 정확한 값은 각 서비스의 사용량 대시보드에서 확인하세요.
정리
- AI는 기억하지 않습니다. 매 턴 전체 대화를 다시 읽고 다시 과금합니다.
- 20턴 대화의 누적 비용은 독립 질문 20개의 25배입니다.
- 문서를 넣고 10턴 대화하면 비용의 80%가 문서 재전송입니다.
- 10턴마다 끊으면 75% 절약됩니다.
- 문서에 대한 질문은 한 번에 모아서 하세요.
측정일: 2026년 9월 20일 / tiktoken 0.14.0 / 인코딩 o200k_base