| {{{#!wiki style="margin:-0px -10px -5px" {{{#!folding [ 펼치기 · 접기 ] {{{#!wiki style="margin:-5px -1px -11px; word-break:keep-all" | OpenAI | GPT (1 · 2 · 3 · 4.x · 5.x · 6개발 중) GPT-OSS (20B · 120B) OpenAI (o1 · o3 · o4) |
| 구글 | Gemini (1 · 1.5 · 2 · 2.5 · 3 · 3.1 · 3.5 · 3.6) Gemma · LaMDA · PaLM 2 | |
| Anthropic | Claude (Fable · Opus · Sonnet · Haiku) | |
| xAI | Grok | |
| 메타 | LLaMA · Muse Spark | |
| HyperCLOVA(네이버) · 카나나(카카오) · 삼성 가우스(삼성전자) · 엑사원(LG AI연구원) · 믿:음(KT) · A.X(SK텔레콤) · Solar(업스테이지) · Motif(모티프) | ||
| Hunyuan · DeepSeek(딥시크) · Qwen · MiniMax(미니맥스 그룹) · GLM(Z.ai) · Xiaomi MiMo(샤오미) · Kimi(Moonshot AI) | ||
| NVIDIA Nemotron(NVIDIA) · Phi(Microsoft) · Apple Foundation Models · OpenELM(Apple) | }}}}}}}}} |
| Muse Spark Muse Spark | |
| 공개일 | 2026년 4월 8일 |
| 제작사 | 메타 초지능 연구소 |
| 기능 | 언어 모델 |
| 링크 | |
1. 개요
메타의 언어 모델.LLaMA 기반의 오픈웨이트 전략을 폐기한 뒤 메타초지능연구소에서 내놓은 첫번째 모델이다.
다만, Muse Spark 1.2와 로컬 실행을 타겟으로 한 Muse Glimmer를 오픈웨이트로 공개함으로써 오픈웨이트 전략이 다시 부활했다.
2. 제품
2.1. Muse Spark 1
2026년 4월 8일, Meta AI 등 내부에서 사용할 프론티어 모델로 홍보받으며 공개되었다.| <rowcolor=#fff> 분류 | Benchmark | Muse Spark Thinking | Opus 4.6 Max | Gemini 3.1 Pro High | GPT 5.4 Xhigh | Grok 4.2 Reasoning |
| MULTIMODAL | CharXiv Reasoning Figure Understanding | 86.4 | 65.3 Self-Reported: 61.5 | 80.2 | 82.8 | 60.9 |
| MMMU Pro Multimodal Understanding | 80.4 | 77.4 | 83.9 | 81.2 | 75.2 | |
| ERQA Embodied Reasoning | 64.7 | 51.6 | 69.4 | 65.4 | 54.1 | |
| SimpleVQA Visual Factuality | 71.3 | 62.2 | 72.4 | 61.1 | 57.4 | |
| ScreenSpot Pro Screenshot Localization - With Python | 84.1 | 83.1 | 84.4 | 85.4 | — | |
| ZeroBench Multi-Step Visual Reasoning (pass@5) - With Python | 33.0 | — | 29.0 | 41.0 | — | |
| TEXT/REASONING | Humanity’s Last Exam Multidisciplinary Reasoning (No Tools) | 42.8 | 40.0 | 45.4 Self-Reported: 44.4 | 43.9 Self-Reported: 39.8 | 31.6 |
| Humanity’s Last Exam Multidisciplinary Reasoning (With Tools) | 50.4 | 53.1 | 51.4 | 52.1 | — | |
| ARC AGI 2 Abstract Reasoning Puzzles (Public) | 42.5 | 63.3 | 76.5 | 76.1 | 53.3 | |
| GPQA Diamond PhD Level Reasoning | 89.5 | 92.7 Self-Reported: 91.3 | 94.3 | 92.8 | 88.5 | |
| LiveCodeBench Pro Competitive Coding | 80.0 | 70.7 | 82.9 Self-Reported: 78.2 | 87.5 | 74.2 | |
| HEALTH | HealthBench Hard Open-Ended Health Queries | 42.8 | 14.8 | 20.6 | 40.1 | 20.3 |
| MedXpertQA (Text) Medical Multiple Choice | 52.6 | 52.1 | 71.5 | 59.6 | 50.2 | |
| MedXpertQA (MM) Medical Multiple Choice | 78.4 | 64.8 | 81.3 | 77.1 | 65.8 | |
| AGENTIC | DeepSearchQA Agentic Search | 74.8 | 73.7 | 69.7 | 73.6 | 62.8 |
| SWE-Bench Verified Agentic Coding | 77.4 | 80.8 | 80.6 | — | 76.7* | |
| SWE-Bench Pro Diverse Agentic Coding | 52.4 | 53.4 | 54.2 | 57.7 | 51.8* | |
| Terminal-Bench 2.0 Agentic Terminal Coding | 59.0 | 65.4 | 68.5 | 75.1 | 47.1* | |
| τ²-Bench Telecom Agentic Tool Use (Artificial Analysis) | 91.5 | 92.1 | 95.6 | 91.5 | 96.5 | |
| GDPval-AA Elo Office Tasks (Artificial Analysis) | 1444 | 1606 | 1320 | 1672 | 1055 |
2.1.1. Muse Spark 1.1
2026년 7월 9일 공개한 뒤 유료API 방식으로 출시했다.# 오픈웨이트 방식을 고수했던 메타가 자사 AI 모델에 돈을 받는 것은 이번이 처음이다.우선적으로는 미국 개발자를 대상으로 입력 100만 토큰당 1.25달러, 출력 100만 토큰당 4.25달러를 부과하며 신규 가입 시 20달러 상당의 무료 크레딧을 제공한다고 한다.
에이전트 기능을 중점에 두고 출시되었는데, 메타가 공개한 벤치마크 비교에 따르면 에이전트와 코딩 영역에서 좋은 결과를 기록했다.[1]
물론 기존에 있던 gpt, claude에 비해서는 아쉽지만, 첫 공개 유료에서 5위권 내의 성능이라는 평이 많다. 다른 모델에 비해 반말을 많이 쓰는 편이다.
2.1.2. Muse Spark 1.2
2026년 8월 6일 공개된 코딩 특화 후속 모델이다.# Muse Spark 1.1을 기반으로 코드 생성, 복잡한 디버깅, 대규모 코드베이스 이해 및 전체 개발 과정 수행 능력을 강화했다.코딩 작업에 사용되는 학습 연산량과 학습 환경의 다양성을 크게 늘렸으며, 최대 100만 토큰의 컨텍스트를 지원한다. 이를 통해 여러 파일을 동시에 수정하거나 장시간 진행되는 개발 작업을 하나의 세션에서 처리하는 데 초점을 맞췄다. 코딩 외에도 기존 모델이 강점을 보였던 도구 사용과 범용 에이전트 성능을 유지했다고 한다.
API 가격은 일반 등급 기준 입력 100만 토큰당 1.25달러, 캐시된 입력 100만 토큰당 0.15달러, 출력 100만 토큰당 4.25달러로 Muse Spark 1.1과 동일하다. 하자만 기여자로 모댈을 사용할 경우 입력0.1$ 출력0.2$ 캐시0.02$로 이전 모델보다 코딩 능력은 향상되었지만 가격을 기여자로 사용할시 대폭 낮춤으로 개인 정보가 필요하지 않은 작업을 사용할때 매우 가성비가 좋은 모댈로 평가 받고 있다. 성능은 GPT-5.6 Terra 와 비슷한 정도다.
2026년 8월 10일, 마크 저커버그가 X에 Muse Spark 1.2를 오픈 웨이트로 공개할 에정이라고 밝혔다.#
[1] 타사 경쟁모델과 비교했을 때 MCP Atlas, JobBench, Finance Agent v2 등 에이전트 영역에서 특히 뛰어난 결과를 기록했으며 코딩 영역에서는 뒤쳐지지 않는 결과를 냈다.