본문 바로가기
AI/LLM

무료 LLM이란? Meta·OpenAI 등 공개형 AI 모델 비교

by eplus 2026. 8. 3.

ChatGPT와 같은 AI 서비스를 직접 사용하다 보면 자연스럽게 이런 생각을 하게 됩니다.

“LLM을 내 컴퓨터나 회사 서버에 설치해 사용할 수 없을까?”

Meta, OpenAI, Google, Mistral AI, Microsoft, Alibaba, DeepSeek, IBM 등은 다운로드해 직접 실행할 수 있는 공개형 LLM을 제공하고 있습니다.

이러한 모델을 이용하면 인터넷 연결 없이 로컬에서 AI를 실행하거나, MES·ERP·문서관리시스템 같은 프로그램에 자체 AI 기능을 넣을 수 있습니다.

다만 ‘무료 LLM’, ‘오픈소스 LLM’, ‘오픈웨이트 LLM’은 의미가 조금씩 다르므로 먼저 구분할 필요가 있습니다.


1. 무료 LLM이란?

무료 LLM은 일반적으로 모델 파일을 내려받아 별도의 API 사용료 없이 실행할 수 있는 언어모델을 의미합니다.

대표적으로 다음과 같은 모델이 있습니다.

  • Meta Llama
  • OpenAI gpt-oss
  • Google Gemma
  • Mistral
  • Microsoft Phi
  • Alibaba Qwen
  • DeepSeek
  • IBM Granite

무료로 모델을 내려받을 수 있더라도 완전히 비용이 들지 않는 것은 아닙니다.

  • GPU 또는 고성능 컴퓨터 구입비
  • 서버 전기요금
  • 클라우드 GPU 사용료
  • 시스템 구축비
  • 모델 운영과 업데이트 비용
  • 보안 및 백업 비용

즉, API 사용료는 없을 수 있지만 모델을 실행하는 비용은 사용자가 부담합니다.


2. 무료·오픈소스·오픈웨이트의 차이

공개형 LLM을 선택할 때 가장 먼저 구분해야 하는 부분입니다.

구분의미
무료 사용 비용 없이 시험하거나 제한적으로 사용
무료 API 일정 사용량까지 API 비용 면제
오픈웨이트 학습이 끝난 모델 가중치 공개
오픈소스 코드와 라이선스가 공개되어 수정·배포 가능
상용 이용 가능 제품이나 유료 서비스에 사용 가능
자체 실행 개인 PC나 회사 서버에서 실행 가능

현재 공개형 LLM 대부분은 모델의 모든 학습 데이터와 학습 과정을 공개한 완전한 오픈소스라기보다, 학습된 모델 가중치를 공개한 오픈웨이트 모델에 가깝습니다.

따라서 모델을 상용 제품에 포함하려면 반드시 다음을 확인해야 합니다.

  • 상업적 이용 가능 여부
  • 모델 수정 가능 여부
  • 재배포 가능 여부
  • 모델명 표시 의무
  • 사용 제한 정책
  • 파생 모델 라이선스
  • 매출 또는 사용자 수에 따른 제한

대표적인 무료·공개형 LLM

3. Meta Llama

Llama는 Facebook과 Instagram을 운영하는 Meta가 개발한 대표적인 공개형 LLM입니다.

공개 LLM 생태계를 크게 확산시킨 모델로, 다양한 AI 개발도구가 Llama 구조를 우선적으로 지원합니다.

대표 계열

  • Llama 2
  • Llama 3
  • Llama 3.1
  • Llama 3.2
  • Llama 3.2 Vision
  • Llama 3.3
  • Llama 4

Llama 3.2에는 소형 1B·3B 모델과 이미지 처리가 가능한 Vision 모델이 포함됐고, Llama 4에는 Scout와 Maverick 같은 MoE 모델이 공개됐습니다. Meta 공식 모델 저장소

주요 특징

  • 공개형 LLM 생태계가 매우 큼
  • 다양한 크기의 모델 제공
  • 일반 대화와 문서 생성에 적합
  • 이미지 입력을 지원하는 모델 제공
  • 파인튜닝 자료와 개발 예제가 많음
  • Ollama, LM Studio, llama.cpp 등에서 폭넓게 지원

라이선스 주의점

Llama는 무료로 내려받아 연구와 상업적 용도로 사용할 수 있지만 Apache 2.0이나 MIT 같은 표준 오픈소스 라이선스는 아닙니다.

Meta의 자체 Llama Community License와 사용정책을 따릅니다. 제품 배포 시 Built with Llama 표시와 같은 조건이 적용될 수 있으므로 상용화 전에 버전별 라이선스를 확인해야 합니다. Llama 4 라이선스

적합한 용도

  • 사내 AI 챗봇
  • 문서 작성과 요약
  • RAG 기반 문서검색
  • 교육용 AI
  • 일반적인 로컬 LLM 실험

4. OpenAI gpt-oss

OpenAI의 ChatGPT용 GPT 모델들은 대부분 클라우드 서비스나 API로 제공됩니다. 그러나 OpenAI는 2025년 8월 자체 실행이 가능한 공개형 모델인 gpt-oss를 발표했습니다.

제공 모델

  • gpt-oss-20b
  • gpt-oss-120b
  • gpt-oss-safeguard-20b
  • gpt-oss-safeguard-120b

gpt-oss는 추론과 도구 사용에 중점을 둔 텍스트 기반 오픈웨이트 모델입니다. Apache 2.0 라이선스로 제공되므로 수정과 상업적 활용이 비교적 자유롭습니다. OpenAI 공개 모델 안내

gpt-oss-20b

전체 약 21B 규모의 MoE 모델이며 토큰을 처리할 때 약 3.6B 파라미터가 활성화됩니다.

  • 비교적 제한된 환경을 위한 모델
  • 로컬 AI와 사내 서버에 적합
  • 코딩과 논리적 추론에 강점
  • 도구 호출과 구조화된 출력 지원
  • 약 16GB급 메모리 환경을 목표로 설계

gpt-oss-120b

전체 약 117B 규모이며 토큰당 약 5.1B 파라미터가 활성화됩니다.

  • 고성능 추론 작업
  • 대규모 사내 AI 서버
  • AI 에이전트
  • 복잡한 문서와 코딩 작업
  • 단일 80GB GPU급 환경을 목표로 설계

두 모델 모두 최대 128K 컨텍스트를 지원하도록 설계됐습니다. gpt-oss 기술 소개

알아둘 점

gpt-oss는 ChatGPT에서 사용하는 GPT 모델과 동일하지 않습니다.

  • ChatGPT에 표시되는 모델이 아님
  • OpenAI API에서 직접 제공되지 않음
  • 사용자가 직접 설치하고 관리
  • 모델 실행에 필요한 하드웨어 필요
  • 공개 모델에 대한 기술지원도 기본적으로 자체 해결

OpenAI gpt-oss 도움말

적합한 용도

  • 로컬 코딩 도우미
  • AI 에이전트 개발
  • 사내 문서 분석
  • 논리적 추론이 필요한 업무
  • 보안이 중요한 자체 서버

5. Google Gemma

Gemma는 Google DeepMind가 Gemini 개발에 사용된 기술을 기반으로 만든 경량 공개 모델 계열입니다.

Gemini가 Google의 클라우드 중심 상용 AI 서비스라면 Gemma는 개발자가 내려받아 직접 실행하고 조정할 수 있도록 제공되는 공개 모델입니다.

대표 계열

  • Gemma
  • CodeGemma
  • PaliGemma
  • ShieldGemma
  • EmbeddingGemma
  • Gemma 3
  • Gemma 4

Gemma 4는 텍스트와 이미지 입력을 처리하며 일부 모델은 음성 입력도 지원합니다. 다양한 크기로 제공되어 고성능 스마트폰부터 노트북과 서버까지 여러 환경을 대상으로 합니다. Google Gemma 공식 문서

주요 특징

  • 비교적 작은 모델부터 제공
  • 로컬과 모바일 환경 고려
  • 다국어 지원
  • 텍스트·이미지 등 멀티모달 모델
  • 코드 생성용 모델 제공
  • 안전성 검사용 ShieldGemma
  • 검색용 임베딩 모델 제공

라이선스

Gemma는 버전과 모델에 따라 적용 조건을 확인해야 합니다. 최신 모델 중에는 Apache 2.0으로 제공되는 모델도 있지만, 과거 모델에는 Google의 Gemma 이용조건이 적용됩니다.

따라서 단순히 Gemma라는 이름만 확인하지 말고 실제 내려받는 모델 카드의 라이선스를 확인해야 합니다.

적합한 용도

  • 모바일 또는 소형 PC AI
  • 이미지와 문서 분석
  • 경량 챗봇
  • 임베딩과 문서검색
  • 교육과 연구
  • Android 앱의 온디바이스 AI

6. Mistral AI 공개 모델

Mistral AI는 프랑스의 AI 기업으로, 성능 대비 크기가 효율적인 공개형 모델을 많이 제공하고 있습니다.

대표 계열

  • Mistral 7B
  • Mixtral
  • Ministral
  • Mistral Small
  • Mistral Large 공개 버전
  • Magistral
  • Devstral
  • Codestral Mamba
  • Pixtral
  • Voxtral

주요 특징

  • 작은 크기 대비 우수한 성능
  • 일반 대화와 문서 작성
  • 코드 개발 전문 모델
  • 이미지 입력 모델
  • 음성과 문자변환 모델
  • MoE 기반 고성능 모델
  • 로컬 및 서버 배포 지원

대부분의 공개 모델은 Apache 2.0으로 제공되지만 일부 모델에는 수정된 MIT 라이선스 등 별도의 조건이 적용됩니다. Mistral도 모델마다 라이선스가 다르므로 모델 카드를 확인하라고 안내합니다. Mistral 모델 목록, Mistral 라이선스 안내

적합한 용도

  • 프로그램 개발 AI
  • 로컬 코딩 도우미
  • 문서 요약과 작성
  • 기업용 RAG
  • 음성인식과 OCR
  • 비교적 효율적인 사내 AI 서버

7. Microsoft Phi

Phi는 Microsoft가 개발한 소형언어모델인 SLM 계열입니다.

거대한 서버보다 노트북, 소형 서버와 엣지 장치에서 실행하는 것을 고려해 만들어졌습니다.

대표 계열

  • Phi-2
  • Phi-3
  • Phi-3.5
  • Phi-4 계열
  • Phi Vision
  • Phi Mini

주요 특징

  • 비교적 작은 모델 크기
  • 제한된 하드웨어에서 실행 가능
  • 논리적 추론과 코딩 지원
  • 텍스트와 이미지 모델 제공
  • 엣지 장치와 온디바이스 AI에 적합
  • Microsoft 개발환경과 연동하기 편리

적합한 용도

  • C# 프로그램의 로컬 AI
  • Windows PC용 AI
  • 소규모 사내 챗봇
  • 엣지 장치
  • 테스트와 학습
  • 인터넷이 제한된 현장 프로그램

Microsoft 환경과 C#을 사용하는 개발자라면 처음 시험해 보기 좋은 모델 계열입니다.


8. Alibaba Qwen

Qwen은 Alibaba Cloud가 개발한 공개형 모델 계열입니다.

일반 언어모델뿐만 아니라 코딩, 이미지, 음성, 수학과 멀티모달 모델까지 종류가 다양합니다.

대표 계열

  • Qwen
  • Qwen2
  • Qwen2.5
  • Qwen3
  • Qwen-Coder
  • Qwen-VL
  • Qwen-Omni
  • QwQ

주요 특징

  • 한국어를 포함한 다국어 처리
  • 다양한 크기의 모델 제공
  • 코딩 전문 모델의 높은 활용도
  • 이미지와 문서 이해
  • 음성·영상까지 처리하는 모델
  • 추론 전용 모델
  • 소형 모델부터 대형 MoE까지 제공

Qwen은 새로운 계열에서 Apache 2.0을 적용한 모델이 많지만, 초기 일부 모델은 Alibaba의 자체 라이선스가 적용됩니다. 따라서 상용 제품에 적용할 때는 개별 모델의 라이선스를 확인해야 합니다.

적합한 용도

  • 한국어·영어 혼합 문서
  • 프로그램 코드 생성
  • OCR 결과 분석
  • 문서와 이미지 질의응답
  • 수학과 논리적 추론
  • MES·ERP용 자연어 인터페이스

9. DeepSeek

DeepSeek은 고성능 추론과 코딩 분야에서 주목받은 공개형 모델 계열입니다.

대표 계열

  • DeepSeek Coder
  • DeepSeek V2
  • DeepSeek V3
  • DeepSeek R1
  • DeepSeek VL
  • DeepSeek Math
  • R1 Distill 모델

주요 특징

  • 코드 생성과 분석
  • 수학과 추론 작업
  • MoE 기반 대형 모델
  • 이미지 이해 모델
  • 작은 모델로 지식을 이전한 Distill 모델 제공
  • 자체 서버와 로컬 환경 지원

DeepSeek-R1의 코드와 모델 가중치는 MIT 라이선스로 공개됐고, 상업적 이용과 수정·파생작업을 지원합니다. 다만 Qwen이나 Llama를 기반으로 만든 Distill 모델은 원본 모델의 라이선스도 함께 적용됩니다. DeepSeek-R1 공식 저장소

적합한 용도

  • 프로그램 개발
  • 복잡한 오류 분석
  • 수학 문제 풀이
  • 논리적 추론
  • 연구용 AI
  • 고성능 사내 AI 서버

10. IBM Granite

Granite는 IBM이 기업 업무를 중심으로 개발한 공개형 모델입니다.

일반 대화뿐만 아니라 코드, 문서, 보안, 시계열 데이터와 기업용 AI 활용을 고려하고 있습니다.

주요 특징

  • 기업 업무 중심 설계
  • 문서 요약과 검색
  • 코드 생성
  • RAG 구성
  • 시계열 데이터 분석
  • 안전성과 통제 기능
  • 비교적 작은 모델 제공

IBM은 Granite 계열을 Apache 2.0 라이선스로 공개하고 있습니다. IBM Granite 소개

적합한 용도

  • 기업 내부 문서검색
  • 생산·설비 데이터 분석
  • RAG 기반 업무도우미
  • 코드 작성
  • 기업용 AI 구축
  • 데이터 통제와 보안이 중요한 환경

11. 대표 공개형 LLM 비교

개발사모델 계열주요 강점라이선스 특징
Meta Llama 생태계와 범용성 Meta 자체 라이선스
OpenAI gpt-oss 추론·코딩·도구 사용 Apache 2.0
Google Gemma 경량·멀티모달·모바일 모델별 확인 필요
Mistral AI Mistral·Mixtral 효율성과 다양한 전문 모델 다수 Apache 2.0
Microsoft Phi 소형·Windows·엣지 모델별 확인 필요
Alibaba Qwen 다국어·코딩·멀티모달 다수 Apache 2.0
DeepSeek R1·V3·Coder 추론·수학·코딩 모델별 MIT·자체 조건
IBM Granite 기업·RAG·문서·데이터 Apache 2.0

12. 모델 이름의 B는 무엇일까?

LLM 이름에는 3B, 7B, 20B, 70B 같은 숫자가 붙습니다.

B는 Billion, 즉 10억을 의미합니다.

표기대략적인 의미
1B 10억 파라미터
3B 30억 파라미터
7B 70억 파라미터
20B 200억 파라미터
70B 700억 파라미터

일반적으로 모델이 크면 복잡한 작업을 더 잘 처리할 가능성이 있지만, 더 많은 메모리와 GPU가 필요합니다.

작은 모델은 속도가 빠르고 운영비가 적으며, 특정 업무에 맞게 RAG나 파인튜닝을 적용하면 상당히 유용할 수 있습니다.


13. 모델 파일의 양자화란?

같은 모델이라도 FP16, INT8, Q8, Q4 등의 형식으로 제공됩니다.

이를 양자화라고 합니다.

형식특징
FP16·BF16 품질이 좋지만 메모리 사용량이 큼
INT8·Q8 품질과 메모리 절감의 균형
Q5 로컬 환경에서 비교적 안정적
Q4 메모리를 크게 줄여 개인 PC에 적합
Q2·Q3 매우 작지만 품질 저하 가능

예를 들어 원본 모델이 너무 커서 실행하기 어렵다면 Q4로 양자화된 GGUF 파일을 사용해 메모리 사용량을 줄일 수 있습니다.

다만 모델 크기, 컨텍스트 길이와 프로그램에 따라 필요한 메모리가 달라지므로 여유 있는 환경이 필요합니다.


14. 공개형 LLM을 실행하는 프로그램

Ollama

명령어 몇 줄로 모델을 내려받고 실행할 수 있는 로컬 LLM 실행도구입니다.

  • 설치가 간단함
  • REST API 제공
  • Windows·macOS·Linux 지원
  • C#, Python, Flask 등과 연동 가능
  • 여러 모델을 쉽게 교체 가능

예시 구조는 다음과 같습니다.

C# MES 프로그램
       ↓
Ollama REST API
       ↓
Qwen·Gemma·Llama·gpt-oss
 

LM Studio

그래픽 화면에서 모델을 검색하고 내려받아 실행할 수 있습니다.

  • 초보자도 사용하기 쉬움
  • 채팅 화면 제공
  • GGUF 모델 실행
  • 로컬 API 서버 제공
  • GPU와 메모리 사용 확인

llama.cpp

CPU와 GPU에서 GGUF 형식 모델을 실행하는 대표적인 오픈소스 엔진입니다.

  • 가벼운 실행환경
  • 다양한 운영체제 지원
  • CPU 실행 가능
  • 여러 양자화 방식 지원
  • 프로그램에 직접 포함 가능

vLLM

여러 사용자가 동시에 접속하는 서버형 LLM 서비스에 적합합니다.

  • 높은 처리성능
  • GPU 서버에 적합
  • OpenAI 호환 API 구성 가능
  • 기업용 사내 AI 서버 구축에 활용

15. 일반 PC에서 실행할 모델 선택

정확한 요구사양은 모델 형식과 컨텍스트 길이에 따라 달라지지만 대략 다음과 같이 접근할 수 있습니다.

사용환경권장 모델 규모
일반 노트북·사무용 PC 1B~4B 양자화 모델
RAM 16GB PC 3B~8B Q4 모델
RAM 32GB PC 7B~14B Q4 모델
고성능 GPU PC 14B~32B 모델
전문 GPU 서버 70B 이상 또는 대형 MoE
모바일·엣지 장치 1B~4B 경량 모델

GPU가 없어도 CPU로 실행할 수 있지만 응답속도가 느릴 수 있습니다.

개인 PC에서 처음 시험할 때는 3B~8B 정도의 Q4 모델이 현실적입니다.


16. 용도별 추천 계열

사용 목적검토할 모델
처음 로컬 AI 시험 Gemma 소형, Phi Mini, Qwen 소형
한국어 일반 대화 Qwen, Gemma, Llama
프로그램 개발 Qwen Coder, DeepSeek Coder, Devstral
논리적 추론 gpt-oss, DeepSeek-R1
이미지·문서 분석 Gemma, Qwen-VL, Llama Vision
기업 문서검색 Granite, Mistral, Llama, Qwen
모바일·엣지 Gemma 소형, Phi, Llama 소형
대규모 사내 AI gpt-oss-120b, 대형 Llama, Mistral
C#·Windows 연동 Phi, gpt-oss, Qwen, Gemma
MES·ERP 업무지원 Qwen, Granite, Mistral, gpt-oss

모델 선택은 유명세보다 실제 회사 문서와 업무 질문을 이용한 비교시험으로 결정하는 것이 좋습니다.


17. MES·ERP에 적용한다면

중소 제조업용 MES나 ERP에 공개형 LLM을 적용하면 다음 기능을 구현할 수 있습니다.

MES 업무도우미

  • 자연어로 생산실적 조회
  • 작업지시 내용 요약
  • 불량 발생 원인 정리
  • 작업일보 자동 작성
  • 납기지연 대상 설명

설비관리 도우미

  • 설비 매뉴얼 검색
  • 고장 증상별 점검항목 안내
  • 설비이력 요약
  • 예방보전 항목 제안

문서관리 도우미

  • 작업표준서 검색
  • 품질문서 요약
  • 문서 개정 전후 비교
  • 사내 규정 질의응답

개발 도우미

  • C# 코드 작성
  • MariaDB SQL 생성
  • 오류 원인 분석
  • 테스트 시나리오 작성
  • 프로그램 설명서 생성

공개형 LLM을 사용한다고 해서 모델에 모든 업무자료를 다시 학습시킬 필요는 없습니다.

RAG를 구성해 필요한 사내 문서를 검색한 뒤 그 내용을 LLM에 전달하는 방식이 더 현실적입니다.

 
 
 

18. 무료 LLM의 장점

  • 외부 API 사용료 절감 가능
  • 회사 내부 서버에서 실행
  • 인터넷이 없어도 사용 가능
  • 데이터 외부 전송 최소화
  • 모델과 프롬프트 직접 조정
  • 서비스 중단 위험 감소
  • 특정 업무에 맞는 RAG 구축
  • API 제공업체 변경에 대한 의존 감소

19. 무료 LLM의 단점

  • GPU와 메모리 필요
  • 설치와 운영기술 필요
  • 모델 업데이트를 직접 관리
  • 대형 상용 모델보다 성능이 낮을 수 있음
  • 동시 사용자가 늘면 서버 확장 필요
  • 모델별 라이선스 확인 필요
  • 보안과 접근권한을 직접 구현
  • 답변 정확성 평가와 관리 필요

따라서 사용자 수가 적고 사용량이 불규칙하면 상용 API가 오히려 경제적일 수 있습니다.

반대로 민감한 내부자료를 처리하거나 사용량이 많고 일정하다면 자체 실행형 LLM이 유리할 수 있습니다.


20. 중소기업에 권장하는 구축 단계

1단계: 개발 PC에서 시험

Ollama 또는 LM Studio를 설치하고 3B~8B 모델을 실행합니다.

2단계: 모델 비교

동일한 한국어 업무질문을 Llama, Gemma, Qwen, Phi 등에 입력해 답변을 비교합니다.

3단계: 사내 문서 연결

작업표준서, 설비 매뉴얼, 품질문서를 RAG 방식으로 연결합니다.

4단계: C# 프로그램 연동

Ollama 등의 로컬 API를 C# WinForms, .NET MAUI 또는 Flask 서버와 연결합니다.

5단계: 사내 AI 서버 구축

사용자가 늘어나면 GPU 서버와 vLLM 등을 이용해 중앙집중형 서비스로 전환합니다.

6단계: 보안과 운영관리

사용자 권한, 질문이력, 문서 접근권한, 개인정보와 답변 검증체계를 구축합니다.


21. 어떤 모델부터 시작하면 좋을까?

현재 C#과 MariaDB 기반의 MES·ERP·문서관리 프로그램에 적용한다면 다음과 같은 순서가 현실적입니다.

  1. Ollama 또는 LM Studio 설치
  2. Qwen 소형 모델로 한국어와 코딩 테스트
  3. Gemma 또는 Phi로 속도 비교
  4. gpt-oss-20b로 추론 성능 비교
  5. 사내 문서를 연결한 RAG 시범 구축
  6. C# 프로그램에서 REST API로 호출
  7. 실제 사용자 질문으로 정확성 평가

처음부터 대형 GPU 서버를 구매하기보다 작은 모델로 기능과 사용성을 검증한 뒤 확장하는 것이 좋습니다.


마무리

무료 LLM은 단순히 비용이 들지 않는 AI가 아닙니다.

정확하게는 사용자가 모델 가중치를 내려받아 자신의 컴퓨터나 서버에서 실행하고, 업무에 맞게 수정하거나 연결할 수 있는 공개형 AI 모델입니다.

대표적인 선택지는 다음과 같습니다.

  • 범용성과 생태계: Meta Llama
  • 추론과 에이전트: OpenAI gpt-oss
  • 경량·모바일·멀티모달: Google Gemma
  • 효율적인 기업용 모델: Mistral
  • Windows와 엣지 환경: Microsoft Phi
  • 한국어·코딩·멀티모달: Alibaba Qwen
  • 추론·수학·코딩: DeepSeek
  • 기업 문서와 RAG: IBM Granite

가장 좋은 LLM은 무조건 크고 유명한 모델이 아닙니다.

우리 회사의 하드웨어에서 적절한 속도로 작동하고, 실제 업무질문에 정확하게 답하며, 라이선스와 보안 조건을 충족하는 모델이 가장 적합한 모델입니다.

조그만 기술로 세상을 이롭게

반응형