태그: LLM
14편
-
vLLM으로 LLM 추론 서버 운영하기: PagedAttention, Continuous Batching, 양자화, Kubernetes 배포
vLLM으로 OpenAI 호환 LLM 추론 서버를 띄우고, PagedAttention과 Continuous Batching이 처리량을 높이는 원리, 프리픽스 캐시, AWQ·GPTQ·FP8 양자화, Tensor Parallel, Kubernetes 배포와 Prometheus 모니터링까지 운영 관점에서 다룹니다.
-
pgvector와 Qdrant로 RAG 벡터 검색 만들기: 임베딩 저장, HNSW 인덱스, 하이브리드 검색
PostgreSQL 확장인 pgvector와 전용 벡터 DB Qdrant에 임베딩을 저장하고 cosine 유사도와 HNSW 인덱스로 검색하는 방법, payload 필터링, 키워드와 벡터를 섞는 하이브리드 검색, LangChain RAG 파이프라인을 다룹니다.
-
LiteLLM으로 여러 LLM을 OpenAI API 하나로 묶기: Fallback, 프록시 게이트웨이, 비용 한도
LiteLLM 정리. OpenAI SDK와 같은 인터페이스로 GPT·Claude·Gemini·Llama 등 여러 LLM을 호출하는 방법, 스트리밍, Fallback, 프록시 게이트웨이와 팀 키·비용 한도, 라우팅, 캐싱, 관측을 다룹니다.
-
ChatGPT·LLM 코드 리뷰·리팩터링 심화 — 내부 메커니즘·정적 분석·컨텍스트·프로덕션 패턴
ChatGPT·Cursor 같은 LLM에 코드 리뷰와 리팩터링을 맡길 때, ESLint·타입 체커 결과를 SARIF로 먼저 넘기고 diff 중심으로 컨텍스트를 채우며, 읽기·위험 분석·패치로 나눈 멀티패스 프롬프트를 쓰는 방법을 설명합니다.
-
Vercel AI SDK로 AI 챗 만들기: 최소 구성부터 스트리밍·도구 호출·RAG·멀티 프로바이더까지
Vercel AI SDK의 streamText와 useChat·useCompletion으로 AI 챗을 만드는 방법. 설치와 최소 구성에서 시작해 스트리밍 중단, 도구 호출, 멀티 프로바이더(OpenAI·Anthropic·Ollama), Edge Runtime, RAG, 운영 체크리스트까지 정리합니다.
-
LangChain.js로 LLM 앱 만들기: Runnable과 LCEL, 문서 분할·임베딩, Pinecone·pgvector RAG
LangChain.js의 Runnable과 LCEL로 프롬프트와 모델을 연결하고, 문서 분할·임베딩 후 Pinecone과 Supabase pgvector에 저장해 RAG를 구현합니다. 스트리밍, 토큰 한도, Next.js App Router 통합까지 다룹니다.
-
Claude API 사용법: Anthropic SDK, 스트리밍, Tool Use, 프롬프트 캐싱과 요금
Claude API(Anthropic SDK) 시작부터 실무 활용까지. API 키 발급, 메시지 API, 스트리밍, Tool Use(함수 호출), 프롬프트 캐싱, Vision, 요금 체계를 Python·TypeScript 예제로 정리했습니다.
-
Ollama로 로컬 LLM 돌리기: 모델 실행, REST·Chat API, LangChain 연동, RAG, Modelfile
Ollama로 로컬에서 LLM을 실행하는 방법. 설치와 CLI, Llama·Mistral 모델 실행, REST API와 Chat API, LangChain 통합, RAG 구현, Modelfile로 모델 커스터마이징을 예제로 정리합니다.
-
브라우저에서 AI 모델 돌리기: Transformers.js, ONNX Runtime Web, WebLLM과 성능 최적화
WebAssembly로 브라우저에서 AI 모델을 실행하는 방법. Transformers.js, ONNX Runtime Web, WebLLM으로 서버 없이 오프라인 추론을 구현하는 과정을 정리합니다.
-
LangChain 실전 가이드 | LLM 애플리케이션 개발 프레임워크
LangChain의 Chain과 Sequential Chain, Few-Shot 프롬프트 템플릿, 대화 메모리 종류별 차이, 커스텀 Tool을 쓰는 Agent, 문서 분할과 벡터 스토어를 이용한 RAG 구현을 Chroma·FAISS·Pinecone 예제로 설명합니다.
-
ChatGPT API 실전 가이드 | OpenAI API로 AI 애플리케이션 만들기
OpenAI ChatGPT API를 서비스에 붙이는 방법. 첫 호출과 대화 이력 관리, 스트리밍, Function Calling, 프롬프트 설계, 토큰·비용 계산과 절감, 재시도·비용 상한, 자주 하는 실수, 입력 검증과 개인정보 마스킹까지 Python 예제로 정리합니다.
-
구조화된 프롬프트 설계: Zero-shot·Few-shot, Chain-of-Thought, ReAct, 시스템 프롬프트, 평가
Zero-shot과 Few-shot 예제 선정, Chain-of-Thought와 Self-Consistency, 도구를 호출하는 ReAct, 코드 리뷰·고객 지원 봇 시스템 프롬프트 설계, JSON 구조화 출력과 프롬프트 체인, A/B 테스트 평가까지 예제로 설명합니다.
-
RAG로 사내 데이터를 LLM에 연결하기: 임베딩과 벡터 DB, 청크 전략, Python 구현
문서를 청크로 나누고 임베딩해 벡터 DB에 넣은 뒤 질문과 가까운 조각을 찾아 LLM 프롬프트에 붙이는 RAG 파이프라인을 Python으로 구현합니다. 청크 크기와 오버랩, 메타데이터 필터링, MMR, 하이브리드 검색과 리랭킹도 비교합니다.
-
Workers AI로 엣지에서 AI 모델 돌리기: 요약 API, Vectorize RAG, D1 연동과 비용
Cloudflare Workers AI로 엣지에서 모델을 호출하는 텍스트 요약 API를 만들고, Vectorize에 임베딩을 저장해 RAG를 구현하며, D1에 결과를 기록하는 과정을 코드로 보여 줍니다. 스트리밍 응답과 캐싱, 요금 계산도 다룹니다.