교내에서 돌리는
생성형 AI 서버 — 외부 API 의존 없이
수업·동아리·연구에서 LLM/이미지 생성을 교내망 안에서 실습합니다. 개인정보·저작물 외부 전송 없이, 한 번 구축하면 학기당 API 비용 0원으로 반복 사용.
빠른 견적 계산기
세금·배송 별도가격 2026-08-27 다나와 기준 — 3060 12GB 45만×2≈90만(알리·다나와 재출시 $329) / 3090 384~438만 / A6000 859만~ / 5090 720~799만(1장, ×2≈1,440~1,600만) / 9900X 54~65만 / 64GB 60~80만 / 990 PRO 64만
구축 목적 · 배경
왜 교내 서버인가문제
- 외부 LLM API는 개인정보·학생 작품 외부 전송 이슈
- 학기당 API 비용 예측 불가, 수업 중 quota 초과
- 인터넷 불안정 시 실습 중단
목표
- 교내망에서 완전 오프라인 LLM 실습
- 동시 10–30명, 큐 기반 공평 배분
- 교사가 모델·프롬프트·로그 직접 관리
기대 효과
- AI 리터러시 · 프롬프트 엔지니어링 정규 수업화
- 동아리/대회용 파인튜닝·데이터셋 실습
- 3년간 총소유비용(TCO) 절감
활용 시나리오
정보·국어·미술 융합
LLM 요약·토론, 이미지 생성으로 포스터 제작. 25명 분반, 5명씩 5그룹 순환 큐. 교사 대시보드에서 프롬프트 로그 확인.
AI 동아리 · 대회 준비
교내 데이터로 LoRA 파인튜닝, 챗봇 제작. 방과후 예약제, 야간 배치 학습 큐. Git으로 프롬프트·데이터 버전 관리.
교사 연구 · 행정 보조
학교 문서 요약·번역, 익명화된 학생 상담 로그 분석(외부 전송 없음). 접근 권한 분리, 감사 로그 보관.
시스템 아키텍처
교내 유선 LAN · 단일 서버 · 큐 기반 (Wi-Fi 아님)HTTPS
queue
- 학생이 Web UI에서 프롬프트 전송
- 큐에서 순서대로 GPU에 배정 (선착순 + 수업 우선)
- 결과 스트리밍, 로그는 서버에만 저장
프롬프트·생성물·로그 모두 서버 로컬 SSD에만 저장. 외부 인터넷 차단 모드 지원. 백업은 관리자 USB로 수동.
사용자 30명+ 시 GPU 1장 추가 또는 별도 추론 서버 분리. 지금은 단일 서버로 시작 — ponytail: 1대로 시작, 필요 시 증설
하드웨어 사양 총괄
권장 구성 기준| 구분 | 권장 스펙 | 비고 | 참고가(원) |
|---|---|---|---|
| GPU | RTX 3090 24GB ×1 / A6000 48GB ×1 / 5090 32GB ×2 | 5090×2는 64GB 집계·최고성능, 1500W 필요 | 384–1,600만 |
| CPU | Ryzen 9 9900X (12C/24T) | 추론 병목은 GPU, CPU는 큐·전처리 담당 | ~54–65만 |
| RAM | DDR5 64GB (32GB×2) | 2026 가격 급등 — 32GB 68만 기준, 64GB 60–80만대 | ~60–80만 |
| 저장장치 | NVMe 2TB (OS+모델) | 모델 1개 4–20GB, 여유 필수 | 34–64만 |
| 메인보드 | AM5 B650 이상, PCIe 4.0 x16 | GPU 전력·발열 고려 ATX | 15–43만 |
| 파워 | 1000W(3090/A6000) / 1500W(5090×2) | 5090×2는 575W×2이므로 1500W 필수 | 10–35만 |
| 케이스/쿨링 | ATX 미들타워, 공랭 쿨러 | 에어플로우·소음 고려 | 17–35만 |
| 합계 (GPU 제외 나머지 235–355만 + GPU) | 약 645–1,855만 | ||
동시 접속 원활도 — Q4 양자화 · 2K 컨텍스트 기준 진짜 동시 생성 vs 큐 순환 체감
vLLM/Ollama · tok/s 15~25 유지 기준| 모델 (Q4_0) | VRAM | 3060×2 24GB* | 3090 24GB | A6000 48GB | 5090×2 64GB | 25명 한 바퀴 |
|---|---|---|---|---|---|---|
| 7B Q4 | ~4.0GB | 6명 | 6명 | 12명 | 14명 | 3060×2 60–90초 / 3090 40–70초 / A6000 25–45초 / 5090×2 20–35초 |
| 16B Q4 | ~9GB | 4명* | 3명 | 7명 | 9명 | 3060×2 2–3분 / 3090 90–150초 / A6000 55–90초 / 5090×2 45–70초 |
| 32B Q4 | ~18GB | 1명(불가) | 1명 | 4명 | 8명 | 3060×2 4–6분(불가) / 3090 4–6분(불가) / A6000 2–3분 / 5090×2 60–90초 |
가정: Q4_0, 컨텍스트 2K, vLLM continuous batching, FP16 KV cache. 4K 이상이면 동시 수 ~30% 감소. *3060×2는 12GB+12GB 분리풀 — 단일 24GB가 아니므로 16B 9GB는 12GB에 꽉 차 빡빡, 32B 불가. 5090×2는 A6000보다 빠르지만 A6000이 전력·안정성·단일GPU 단순성에서 유리.
GPU 비교
선택의 핵심 — VRAM과 안정성- 장점: 가격 절반, 7B Q4~13B Q5까지 수업 충분, 생태계 넓음
- 단점: 블로워 아님(케이스 발열), 중고 리스크, ECC 없음
- 적합: 정보 수업·동아리·포스터 생성 중심
선택 가이드 (한 줄)
CPU · RAM · 스토리지 상세
CPU Ryzen 9 9900X
12코어 24스레드. 추론은 GPU가 하므로 CPU는 큐·전처리·동시 요청 조율 역할. AM5 소켓으로 향후 교체 여지 있음.
RAM DDR5 64GB (32×2) 권장
모델 로딩·KV 캐시에 직접 영향. 2026년 DDR5 가격 인플레이션으로 32GB 68만원대까지 상승 — 64GB 60–80만원대 예산 필요.
SSD NVMe 2TB 2TB 권장
OS + 모델 저장. 모델 1개 4–20GB, 10개면 100GB+. DRAM 캐시 있는 NVMe 권장.
소프트웨어 스택
모두 오픈소스, 외부 결제 없음OpenAI 호환 API 제공. vLLM은 고성능, Ollama는 설치 간단. 둘 중 하나만 택 — ponytail: Ollama로 시작
ChatGPT 유사 UI, 사용자·대화·모델 관리. 교사/학생 권한 분리, 프롬프트 로그.
접속 방식 (학생 시점)
- 교내 유선 LAN에서 http://10.154.2n.n:3000 접속 (동일 로컬 IP 대역, Wi-Fi 아님 — 예: 10.154.20.10)
- 수업 코드(또는 학번)로 로그인
- 모델 선택 → 프롬프트 → 스트리밍 응답
- 대화 내역은 서버에만 저장(학생이 삭제 가능)
교사 관리 기능
- 모델 on/off, 동시 요청 수 제한
- 수업별 큐(우선순위) 설정
- 사용량 대시보드(요청 수·토큰·실패율)
- 유해 프롬프트 필터(키워드 기반)
하지 않는 것 (YAGNI)
쿠버네티스, SSO 연동, 자체 회원 DB, 결제 — 전부 제외. 파일 기반 + WebUI 내장 인증으로 충분. 필요해지면 그때 붙인다.
모델 운영 계획
기본 탑재 (3종)
운영 모드
업데이트·백업
- 모델 추가: 관리자 USB로 gguf 옮겨 등록 (1분)
- 백업: 주 1회 SSD → 외장 HDD 미러
- 로그: 30일 보관 후 자동 삭제(개인정보 최소화)
- 전원: UPS 권장(정전 시 10분 버퍼)
예산 · 견적
2026-08-27 검색 기준 · 부가세/배송 별도- 7B 6명 60–90초 수업 가능
- 가장 저렴, 340W 저전력
- 수업·동아리 충분 (7–20B)
- 단일 24GB, 관리 단순
- 상위 옵션으로 안정성 ↑
- 소음·발열 개선
- 34B·장시간 안정
- ECC·블로워 300W 저전력
- 32B 25명 60–90초
- A6000보다 2배 빠름
부품별 가격 상세 (범위)
출처: 다나와·알리·기사 (2026-08-27) — 클릭하면 접기/펼치기| 부품 | 모델 예시 | 최저 | 최고 | 비고 |
|---|---|---|---|---|
| GPU(예산형) | RTX 3060 12GB ×2 — 재출시 $329/장 (GIGABYTE/MSI 등) | 800,000 (40만×2) | 1,100,000 (55만×2) | 다나와·알리 40–55만/장, 분리 24GB |
| GPU | RTX 3090 24GB (GIGABYTE/EVGA) | 3,844,680 | 4,377,310 | 다나와 최저가, 단일 24GB |
| GPU(대안) | RTX A6000 48GB | 8,591,990 | 8,990,000 | 다나와 단일 판매처~ |
| GPU(고성능) | RTX 5090 32GB ×2 — ASUS/GIGABYTE/ZOTAC | 14,400,000 (720만×2) | 15,980,000 (799만×2) | 7,200,000~7,980,000/장 |
| CPU | Ryzen 9 9900X | 545,400 | 650,000 | 알리특가 / 출고가 $499 환산 |
| RAM | DDR5 64GB (32×2) — Corsair 등 | 600,000 | 800,000 | 32GB 682,500원 기준 추정 (인플레) |
| SSD | NVMe 2TB — Patriot P300 / 삼성 990 PRO | 348,740 | 647,790 | 가성비↔성능 |
| 메인보드 | B650M-K / TUF B650M-PLUS | 150,550 | 430,620 | ATX 권장 |
| 파워 | 1000W — ENTIS NCM / MAXELITE | 108,500 | 219,000 | 80+ Gold 이상 |
| 케이스 | be quiet Pure Base 500 / Corsair 7000D | 155,940 | 319,320 | 에어플로우 |
| 쿨러 | DEEPCOOL AG400 / AG620 | 21,600 | 37,480 | 공랭 |
※ 3060×2 90만은 재출시 $329/장 기준 40–55만×2의 중간값, 7B 수업용으로는 3090 단일보다 320만 저렴하나 12GB 분리풀이라 16B 9GB가 꽉 차 빡빡·32B 불가. 5090은 장당 720~799만, ×2 시 A6000보다 +620만. RAM은 폭등으로 가장 변동 큼.
3년 총소유비용(TCO) 비교 — 자체 서버 vs 외부 API
외부 API는 학급당 월 5–10만원×10학급 가정 시 연 300만원대. 자체 서버는 1년차에 손익분기, 2년차부터 절감. 개인정보 이슈는 별도 가치.
구매 체크리스트
- 3곳 이상 견적서 비교(다나와·조달·오프라인)
- 전력: 220V 단독 콘센트, 15A 이상 차단기
- 공간: 전산실 랙 또는 준비실, 배기 20cm 이격
- 조달: 학교 구매 절차·계약 방식 사전 확인
- 보험: 화재·도난 대비 자산 등록
대안 비교
왜 자체 서버인가 — 외부 API/클라우드와 비교| 구분 | 자체 서버(본안) | 외부 LLM API | 클라우드 GPU 대여 |
|---|---|---|---|
| 비용 | 1회 650–1,180만, 이후 0원 | 연 200–400만 (사용량 비례) | 시간당 2–4천원 × 수업시간 |
| 개인정보 | 교내 보관, 외부 전송 0 | 외부 전송 필수, 약관 의존 | 외부 전송, 리전 선택 필요 |
| 인터넷 의존 | 오프라인 가능 | 필수 | 필수 |
| 관리 난이도 | 중간(담당자 필요) | 낮음 | 중간 |
| 확장성 | GPU 추가 시 증설 | 무제한 | 유연 |