시스템 프롬프트 설계 패턴 — 역할·제약·예시 주입으로 일관성 높이기
시스템 프롬프트는 LLM 애플리케이션의 헌법입니다. 사용자 메시지보다 먼저 처리되어 모델의 전체 응답 방향을 결정하며, 잘 설계된 시스템 프롬프트 하나가 수백 […]
시스템 프롬프트는 LLM 애플리케이션의 헌법입니다. 사용자 메시지보다 먼저 처리되어 모델의 전체 응답 방향을 결정하며, 잘 설계된 시스템 프롬프트 하나가 수백 […]
AI API를 프로덕션에 연결하는 순간 반드시 마주치는 문제가 레이트 리밋(rate limit)입니다. 모델이 느려서가 아니라, 분당 요청 수(RPM)나 분당 토큰 수(TPM)
검색의 무게중심이 “링크 열 개를 보여 주는 화면”에서 “질문에 바로 답하는 화면”으로 옮겨 가고 있습니다. ChatGPT, Perplexity, 구글 AI 개요
LLM API가 응답 전체를 한 번에 돌려주기를 기다리면 사용자는 수 초~수십 초를 빈 화면 앞에서 기다립니다. 스트리밍은 모델이 토큰을 생성하는
블로그나 문서 사이트의 검색창에 “비밀번호 까먹었어요”라고 쳤는데, 정작 필요한 “계정 재설정 안내” 글이 안 나온 적이 있을 겁니다. 기존 키워드
LLM 비용은 호출 횟수가 아니라 주고받은 토큰의 양으로 결정됩니다. 같은 요청 한 건이라도 프롬프트가 길거나 답변이 길면 비용이 몇 배로
LLM을 프로덕션에 올리는 순간, 모델을 교체하거나 프롬프트를 바꿀 때마다 출력 품질이 좋아졌는지 나빠졌는지를 체계적으로 측정해야 합니다. 사람이 매번 출력을 읽고
멀티모달 LLM은 텍스트와 이미지를 함께 받아 처리하는 모델입니다. 실무에서는 언제 Vision API를 쓰고, 언제 문서 전용 파서를 선택해야 하는지의 판단이
웹훅은 외부 서비스가 이벤트 발생 시 우리 엔드포인트로 HTTP 요청을 보내는 역방향 통신입니다. 편리하지만 분산 시스템의 현실을 그대로 안고 있습니다.
LLM이 혼자서 텍스트를 생성하는 것을 넘어 외부 시스템을 직접 호출하고 결과를 받아 다음 행동을 결정하는 구조가 AI 에이전트의 핵심입니다. 그