최근 수정 시각 : 2026-08-16 00:53:28

Muse Spark


{{{#!wiki style="margin:-0px -10px -5px"
{{{#!folding [ 펼치기 · 접기 ]
{{{#!wiki style="margin:-5px -1px -11px; word-break:keep-all"
OpenAI GPT (1 · 2 · 3 · 4.x · 5.x · 6개발 중)
GPT-OSS (20B · 120B)
OpenAI (o1 · o3 · o4)
구글 Gemini (1 · 1.5 · 2 · 2.5 · 3 · 3.1 · 3.5 · 3.6)
Gemma · LaMDA · PaLM 2
Anthropic Claude (Fable · Opus · Sonnet · Haiku)
xAI Grok
메타 LLaMA · Muse Spark
파일:대한민국 국기.svgHyperCLOVA(네이버) · 카나나(카카오) · 삼성 가우스(삼성전자) · 엑사원(LG AI연구원) · 믿:음(KT) · A.X(SK텔레콤) · Solar(업스테이지) · Motif(모티프)
파일:중국 국기.svgHunyuan · DeepSeek(딥시크) · Qwen · MiniMax(미니맥스 그룹) · GLM(Z.ai) · Xiaomi MiMo(샤오미) · Kimi(Moonshot AI)
파일:미국 국기.svgNVIDIA Nemotron(NVIDIA) · Phi(Microsoft) · Apple Foundation Models · OpenELM(Apple) }}}}}}}}}
Muse Spark
Muse Spark
공개일 2026년 4월 8일
제작사 메타 초지능 연구소
기능 언어 모델
링크 파일:홈페이지 아이콘.svg 파일:허깅페이스 아이콘.svg

1. 개요2. 제품
2.1. Muse Spark 1
2.1.1. Muse Spark 1.12.1.2. Muse Spark 1.2

1. 개요

메타언어 모델.

LLaMA 기반의 오픈웨이트 전략을 폐기한 뒤 메타초지능연구소에서 내놓은 첫번째 모델이다.

다만, Muse Spark 1.2와 로컬 실행을 타겟으로 한 Muse Glimmer를 오픈웨이트로 공개함으로써 오픈웨이트 전략이 다시 부활했다.

2. 제품

2.1. Muse Spark 1

2026년 4월 8일, Meta AI 등 내부에서 사용할 프론티어 모델로 홍보받으며 공개되었다.
<rowcolor=#fff> 분류 Benchmark Muse Spark
Thinking
Opus 4.6
Max
Gemini 3.1 Pro
High
GPT 5.4
Xhigh
Grok 4.2
Reasoning
MULTIMODAL CharXiv Reasoning
Figure Understanding
86.4 65.3
Self-Reported: 61.5
80.2 82.8 60.9
MMMU Pro
Multimodal Understanding
80.4 77.4 83.9 81.2 75.2
ERQA
Embodied Reasoning
64.7 51.6 69.4 65.4 54.1
SimpleVQA
Visual Factuality
71.3 62.2 72.4 61.1 57.4
ScreenSpot Pro
Screenshot Localization - With Python
84.1 83.1 84.4 85.4
ZeroBench
Multi-Step Visual Reasoning
(pass@5) - With Python
33.0 29.0 41.0
TEXT/REASONING Humanity’s Last Exam
Multidisciplinary Reasoning (No Tools)
42.8 40.0 45.4
Self-Reported: 44.4
43.9
Self-Reported: 39.8
31.6
Humanity’s Last Exam
Multidisciplinary Reasoning (With Tools)
50.4 53.1 51.4 52.1
ARC AGI 2
Abstract Reasoning Puzzles (Public)
42.5 63.3 76.5 76.1 53.3
GPQA Diamond
PhD Level Reasoning
89.5 92.7
Self-Reported: 91.3
94.3 92.8 88.5
LiveCodeBench Pro
Competitive Coding
80.0 70.7 82.9
Self-Reported: 78.2
87.5 74.2
HEALTH HealthBench Hard
Open-Ended Health Queries
42.8 14.8 20.6 40.1 20.3
MedXpertQA (Text)
Medical Multiple Choice
52.6 52.1 71.5 59.6 50.2
MedXpertQA (MM)
Medical Multiple Choice
78.4 64.8 81.3 77.1 65.8
AGENTIC DeepSearchQA
Agentic Search
74.8 73.7 69.7 73.6 62.8
SWE-Bench Verified
Agentic Coding
77.4 80.8 80.6 76.7*
SWE-Bench Pro
Diverse Agentic Coding
52.4 53.4 54.2 57.7 51.8*
Terminal-Bench 2.0
Agentic Terminal Coding
59.0 65.4 68.5 75.1 47.1*
τ²-Bench Telecom
Agentic Tool Use (Artificial Analysis)
91.5 92.1 95.6 91.5 96.5
GDPval-AA Elo
Office Tasks (Artificial Analysis)
1444 1606 1320 1672 1055

2.1.1. Muse Spark 1.1

2026년 7월 9일 공개한 뒤 유료API 방식으로 출시했다.# 오픈웨이트 방식을 고수했던 메타가 자사 AI 모델에 돈을 받는 것은 이번이 처음이다.

우선적으로는 미국 개발자를 대상으로 입력 100만 토큰당 1.25달러, 출력 100만 토큰당 4.25달러를 부과하며 신규 가입 시 20달러 상당의 무료 크레딧을 제공한다고 한다.

에이전트 기능을 중점에 두고 출시되었는데, 메타가 공개한 벤치마크 비교에 따르면 에이전트와 코딩 영역에서 좋은 결과를 기록했다.[1]

물론 기존에 있던 gpt, claude에 비해서는 아쉽지만, 첫 공개 유료에서 5위권 내의 성능이라는 평이 많다. 다른 모델에 비해 반말을 많이 쓰는 편이다.

2.1.2. Muse Spark 1.2

2026년 8월 6일 공개된 코딩 특화 후속 모델이다.# Muse Spark 1.1을 기반으로 코드 생성, 복잡한 디버깅, 대규모 코드베이스 이해 및 전체 개발 과정 수행 능력을 강화했다.

코딩 작업에 사용되는 학습 연산량과 학습 환경의 다양성을 크게 늘렸으며, 최대 100만 토큰의 컨텍스트를 지원한다. 이를 통해 여러 파일을 동시에 수정하거나 장시간 진행되는 개발 작업을 하나의 세션에서 처리하는 데 초점을 맞췄다. 코딩 외에도 기존 모델이 강점을 보였던 도구 사용과 범용 에이전트 성능을 유지했다고 한다.

API 가격은 일반 등급 기준 입력 100만 토큰당 1.25달러, 캐시된 입력 100만 토큰당 0.15달러, 출력 100만 토큰당 4.25달러로 Muse Spark 1.1과 동일하다. 하자만 기여자로 모댈을 사용할 경우 입력0.1$ 출력0.2$ 캐시0.02$로 이전 모델보다 코딩 능력은 향상되었지만 가격을 기여자로 사용할시 대폭 낮춤으로 개인 정보가 필요하지 않은 작업을 사용할때 매우 가성비가 좋은 모댈로 평가 받고 있다. 성능은 GPT-5.6 Terra 와 비슷한 정도다.

2026년 8월 10일, 마크 저커버그가 X에 Muse Spark 1.2를 오픈 웨이트로 공개할 에정이라고 밝혔다.#
[1] 타사 경쟁모델과 비교했을 때 MCP Atlas, JobBench, Finance Agent v2 등 에이전트 영역에서 특히 뛰어난 결과를 기록했으며 코딩 영역에서는 뒤쳐지지 않는 결과를 냈다.