JSCODE Logo
JSCODE 박재성JSCODE 제이온JSCODE 시니
온라인 강의프로그래밍 과외책/전자책무료 강의
유튜브블로그
후기
완강 후기 이벤트블로그 리뷰 이벤트AWS SAA 합격 후기 이벤트
회사명 : JSCODE대표 : 박재성사업자 등록번호 : 244-22-01557통신판매업 : 제 2023-인천미추홀-0381 호

서울특별시 구로구 경인로 20가길 11(오류동, 아델리아)

Copyright ⓒ 2026 JSCODE - 최상위 현업 개발자들의 프로그래밍 교육 All rights reserved.

이용약관개인정보처리방침

실무에 바로 적용하는 Spring AI: Spring 서비스에 챗봇·RAG·MCP 도입하기

백엔드 개발자를 위한 LLM 기초

Prompt란 무엇일까?
Tokens란 무엇일까? /
Embeddings란 무엇일까? / Semantic Space
Fine Tuning이란 무엇일까?
RAG란 무엇일까?
AI Models란 무엇일까?
AI Model Providers란 무엇일까?

Spring AI 기본기

Spring AI란 무엇일까? / 백엔드 개발자가 왜 Spring AI를 배워야할까?
Spring AI 1.0 GA의 탄생
Spring AI와 LangChain - 어떤 도구를 선택해야 할까?
Spring AI와 LangChain - Chat Model 쉽게 이해하기
Spring AI와 LangChain - VectorStore 인터페이스

Spring AI 핵심 구성요소

핵심 컴포넌트 - ChatClient, Advisors, Prompts, Models, Structured Output
Spring AI ChatClient란 무엇일까?
Spring AI Advisor란 무엇일까?
Spring AI Prompts란 무엇일까?
Spring AI Models이란 무엇일까?
Spring AI Structured Output이란 무엇일까?

Spring AI로 만드는 채팅 API — 클라우드(OpenAI)와 로컬(Ollama

[실습] Spring AI 로컬 환경 설정 - Spring Boot 4.x, Gradle
[실습] OpenAI API Key 발급받기
[실습] OpenAI API를 활용한 채팅 API 환경 구축
[실습] Swagger UI를 활용한 테스트 - OpenAI API
[실습] Ollama 설치하기 / Hugging Face란 무엇일까? / GGUF
[실습] Ollama를 활용한 채팅 API 환경 구축
[실습] Swagger UI를 활용한 테스트 - Ollama
Spring AI 응답의 형태 - ChatClient Responses
[실습] Streaming으로 Flux 형태로 응답받기

실무에 쓰는 챗봇 만들기 - ‘대화 기억’부터 ‘CS 문의 자동 분류’까지

Spring AI Prompts - Chat Options란 무엇일까?
Spring AI Prompts - 프롬프트 엔지니어링 9가지 패턴
[실습] CLI 챗봇 개발 환경 아키텍처 미리보기
[실습] Chat Memory Advisor로 메모리 기능 추가하기
[실습] Chat Service 구현 - Advisor, CONVERSATION_ID
[실습] Spring Boot에서 CLI 기능 구현 및 테스트하기
[실습] Chat Controller 구현 - call과 stream 방식의 Chat REST API
[실습] Structured Output Converter를 통한 쇼핑몰 CS 문의 긴급도 분류하기

Vector Database와 유사도 검색 - RAG를 위한 핵심 개념

Vector Database란 무엇일까?
Vector Database Cosine Similarity란 무엇일까? / Spring AI의 Similarity Score
Spring AI Vector Store API
Metadata Filters란 무엇일까?

RAG 챗봇 만들기 - 데이터 전처리부터 ElasticSearch 연동까지

LLM 한계 극복을 위한 RAG 도입
실무에서 Spring AI를 통한 RAG 구현 방법
고품질 RAG를 위한 데이터 전처리 - Extract, Transform, Load
Spring AI RAG 기본 설계
[실습] RAG 챗봇 개발을 위한 로컬 환경 구축
[실습] RAG ETL 파이프라인 구현
[실습] RAG Advisors 구현
[실습] RAG Service 구현
[실습] RAG CLI 구현 및 실행 테스트
[실습] RAG REST API 구현
[실습] Docker 설치
[실습] ElasticSearch 기반 VectorStore로 변경하기

AI와 외부 시스템 연결하기 - Tool Calling으로 API 호출 자동화

Spring AI Tool Calling과 작동 프로세스
[실습] Tool Calling 개발 환경 구축
[실습] 지역별 날씨 조회 외부 API Tool 구현
[실습] Tool Service 구현
[실습] ToolCallingManager 설정
[실습] ToolChatConfig, ToolController 구현 - CLI, REST API
[실습] CLI 및 REST API 테스트

MCP로 완성하는 AI 연동 - Client & Server 개발과 외부 서버 활용

MCP란 무엇일까?
Tool Calling VS MCP
[실습] 아키텍처 미리보기
[실습] MCP Client 개발 환경 구축
[실습] MCP Server 개발 환경 구축
[실습] 외부 MCP Server와 연동한 실시간 날씨 조회 - MCP Client 개발
[실습] 외부 MCP Server와 연동한 실시간 날씨 조회 - MCP Server 개발
[실습] 외부 MCP Server와 연동한 실시간 날씨 조회 - MCP 연동
[실습] CLI 및 RestAPI 테스트
← 블로그 목록으로 돌아가기

Tokens란 무엇일까? /

JSCODE 시니
JSCODE 시니
2026. 06. 13.
author
JSCODE 시니
category
Spring AI
createdAt
Jun 13, 2026 09:48 AM
isPublic
isPublic
series
실무에 바로 적용하는 Spring AI: Spring 서비스에 챗봇·RAG·MCP 도입하기
slug
llm-tokens-and-context-window
type
post
updatedAt

✅ 1. Tokens란 무엇일까?

  • AI 모델이 사람의 언어(입력)를 읽고, 답변(출력)을 만들어낼 때 사용하는 가장 작은 데이터 처리 단위
  • 사람은 글을 읽을 때 '단어'나 '문장' 단위로 의미를 이해하지만, AI는 텍스트를 일정한 길이의 조각(토큰)으로 쪼개서 소화함
OpenAI Platform
OpenAI Platform
https://platform.openai.com/tokenizer
OpenAI Platform
notion image
💁‍♀️
토큰은 글자 수나 단어 수와 정확히 일치하지 않습니다. 영어 기준으로 보통 1단어가 1~1.2토큰 정도이며, 한글은 언어 구조상 영어보다 더 많은 토큰으로 쪼개지는 경향이 있습니다. (예: "안녕하세요" -> 여러 개의 토큰으로 분해됨)
 
 
 

✅ 2. Tokens 변환 과정

우리가 채팅창에 글을 쓰면, AI는 그 글씨를 그대로 읽는 것이 아니라 내부적으로 '변환' 과정을 거침
  • 입력(사용자 ⇒ AI)
    • 사용자가 입력한 자연어(단어) ⇒ Token으로 쪼개서 변환 ⇒ AI 모델이 연산 및 처리
  • 출력 (AI ⇒ 사용자)
    • AI가 생성한 결과물(Token) ⇒ 다시 사람의 언어(단어)로 변환 ⇒ 화면에 텍스트로 출력
 
 
 

✅ 3. Tokens는 곧 비용

기업에서 AI(OpenAI, Anthropic 등)를 연동해서 서비스(API)를 만들 때, 가장 중요하게 고려해야 할 부분이 바로 비용임
  • 과금 방식 : AI 서비스는 우리가 '몇 개의 질문'을 했는지가 아니라, '몇 개의 토큰'을 소모했는지를 기준으로 요금을 매김
  • 합산 기준 : 요금은 내가 질문할 때 보낸 글자 수(입력 토큰)와 AI가 대답한 글자 수(출력 토큰)를 모두 합산하여 청구됨
💁‍♀️
프롬프트 엔지니어링을 할 때 너무 불필요하게 긴 배경 설명을 넣으면, 답변을 받기도 전에 어마어마한 입력 토큰 비용이 발생할 수 있으니 참고하세요!
 
 
 

✅ 4. Context Window란 무엇일까?

토큰은 비용의 문제이기도 하지만, AI의 '기억력 한계'를 결정짓는 아주 중요한 개념임
  • Context Window란 AI 모델이 단 한 번의 호출(질문-답변)에서 까먹지 않고 동시에 처리할 수 있는 최대 토큰의 한계치를 뜻함
  • Context Window가 4K(약 4,000토큰)인 AI에게 10,000토큰짜리 긴 PDF 문서를 요약하라고 주면, AI는 용량 초과로 에러를 뱉거나 앞부분의 내용을 잊어버리게 됨.
  • 따라서 Context Window를 잘 이해하고 있어야 함.
 
 
 

✅ 5. AI 모델별 Context Window 크기

기술이 발전함에 따라 AI가 한 번에 읽을 수 있는 문서의 양(토큰 수)은 기하급수적으로 늘어나고 있음
  • GPT-3: 약 4K (짧은 대화 위주)
  • GPT-4: 8K / 16K / 32K (문서 몇 장 분량 소화 가능)
  • Claude (Anthropic): 100K 이상 (책 한 권 분량 소화 가능)
  • Meta (Llama 등) 및 최신 모델: 100만 이상 (방대한 데이터 및 긴 코드 분석 가능)