1. 개요
홈페이지Microsoft의 인하우스 AI모델 자회사. 무스타파 슐레이만이 대표이며, 주로 이름을 줄인 MAI 라고 통칭되며 이 통칭은 자체 모델의 이름으로도 쓰인다.
원래 OpenAI의 모델을 받아쓰던 MS가 자체적인 언어모델구축에 투자하면서 개발 중인 MAI 모델을 만들고 있다. MAI모델이 목표하는 바는 기존 OpenAI의 모델을 대체하기 보다는 더 저렴한 연산비용으로 자사 AI 서비스를 보조하는 것을 목표로 개발되고 있다고는 하나 이미 MAI-code1-Flash 가 GitHub Copilot에서 GPT4-Turbo를 완전히 대체하고 MAI image 2.5 Flash가 bing 이미지 생성에서 GPT4o 이미지 생성을 대체하는 등 OpenAI에 의존하던 모델생성을 점진적으로 대체해 나가는 중이다.
이때문에 자사 개발모델을 홍보할때도 타 회사들과는 다르게 자사가 개발한 인원이 최소한의 인원으로 개발해서 최대의 효율로 굴러간다고 자랑한다는 특징이 있으며 언어 모델도 타 회사의 프론티어급 최상위 LLM이 아닌 LLM급 성능을 내는 중형 모델을 목표로[1] 이루어지고 있다.
기존에 MS에서 개발하던 Phi하고는 전혀 연관성이 없는데 Phi는 Azure AI파운더리 팀이 주관하는 프로젝트이기 때문이다. 때문에 오픈소스인 Phi하고는 다르게 클로즈드 소스로 개발되는 프로젝트다.
2. 모델
2.1. MAI
2.1.1. MAI 1
소개2.1.2. MAI Thinking 1
소개2.2. 코딩
2.2.1. MAI Code 1 Flash
소개Claude Haiku 4.5 보다 훨씬 뛰어난 성능과 가성비를 목표로 한 모델로, 해당 소개글에 등장하는 모든 벤치마크 테스트에서 압도적인 성능과 가성비를 지니고 있음을 증명했다.
GitHub Copilot에서 자유롭게 사용해볼 수 있다. Haiku 4.5 보다 훨씬 더 긴 Context를 가지고 있으며, Copilot 내에서 사용하는 크레딧 소모량도 훨씬 더 적다.
2.2.2. MAI Code 1.1 Flash
소개기존 Code 1 Flash를 개선해 1/4 가격으로 25% 더 빠르게, 더 효율적으로 작동한다고 한다.
그 결과, 터미널을 다루는 Terminal-Bench 에서 22% 향상이 이뤄졌으며, .NET을 다루는 능력도 15%정도 향상됐다고 한다.
이 모델 또한 출시 1일차부터 바로 Github Copilot에서 사용해볼 수 있다.
2.3. 이미지
2.3.1. MAI Image 1
소개Bing의 이미지 생성 서비스에서 사용이 가능하며 자체적으로는 "현실적/역동적"이미지 생성으로 분류하고 있다.
2.3.2. MAI Image 2
소개차세대 이미지 생성 모델.
생성 효율성에 집중한 2e 모델이 별도로 생겼고 Bing에서도 개발이 중단된 DALL-E를 대체하기 위해 해당 모델로 이미지생성을 서비스하기 시작했다.
2.3.3. MAI Image 2.5
소개GPT image 2대비 84% 가량 구동 비용이 적으며 가장 큰 특징중 하나는 이미지 생성이 아닌 원래 존재하던 이미지의 편집능력이 추가된 것이다.
출시 순서대로 3가지 모델로 구분된다.
- Image 2.5 : GPT-Image 2 처럼 강력한 일관성과 높은 수준의 이미지 편집 능력을 부여했다. 그 결과, Arena에서 GPT-Image 1.5와 Nano Banana Pro를 완전히 꺾어놓는 선호도를 보여주고 있으며, Nano Banana 2와 엎치락 뒤치락 하는 수준에 도달했다.
- image 2.5 Flash : Image 2e처럼 생성 효율성에 집중한 모델. Bing 이미지 생성에서 DALL-E와 GPT4o 이미지 생성을 완전히 대체한 모델이다
- Image 2.5 Pro : 가장 성능이 좋은 모델. 이미지 내 텍스트 일관성과 더 높은 해상도의 이미지를 처리하는데 특화되어 있다.
2.3.4. MAI Image 2.6
소개이미지 속 텍스트 랜더링 개선, 더 나은 초상화 / 3D 이미지, 더욱 세련된 상업용 / 사실적인 결과물 제공에 초점을 맞췄다고 한다. 그 결과, 기존 2.5를 큰 폭으로 뛰어넘는 성과를 이뤘으며, 출시 당시 Meta나 SpaceXAI의 최신 이미지 모델도 모조리 따돌리는 강력한 성능을 보여줬다.
2.4. TTS
2.4.1. MAI Voice 1
copilot aduio expression최소한의 GPU모델만으로 빠른 속도로 음성을 생성하는 것을 목표로 한 모델이다.
2.4.2. MAI Voice 2
소개2.5. STT
2.5.1. MAI Transcribe 1
소개25가지 언어를 지원하며, 출시 당시 SOTA로 칭송받던 Gemini 3.1 Flash, Scribe v2, GPT-4o-Transcribe 보다 2.5배 빠른 속도로 처리할 수 있다는점과 타사 모델 대비 낮은 오류율을 강점으로 내새웠다.
2.5.2. MAI Transcribe 1.5
소개43가지 언어를 지원하며, 모델 출시 당시 SOTA로 칭송받던 Gemini 3.1, Scribe v2, GPT-4o-Transcribe 보다 5배 빠른 속도로 인식이 가능하고, 타사 모델 대비 압도적으로 적은 인식 오류율을 보여주는 모델이다. 거의 15초만에 1시간 분량 오디오를 처리할 수 있다고 한다. 그리고 타 모델들이 분당 요금을 책정하는 반면, 이 모델의 경우 시간당 요금을 책정했다.
2.6. 사이버보안
2.6.1. MAI Cyber 1 Flash
자체적인 보안 하네스엔지니어링 툴인 MDASH 에 통합된 자체적인 보안 모델이다.MDASH 시스템에 매우 깊숙하게 통합되어있는 모델로 MDASH 툴을 잘 활용할 경우 최상위 GPT모델을 사용한 경우에 비해 50% 의 비용만으로도 더 높은 취약점 식별능력을 제공한다고하며 CyberGym 테스트에서도 GPT5.6/제미나이 3.5 플래시 사이버/클로드 미쏘스 보다도 높은 성능을 보여준다고 홍보한다.
3. MAI Playground
링크개발한 AI를 시현하는 자체적인 사이트가 있으며 여기서 일부 최신 모델을 사용해볼수 있다.
2026년 6월 기준으로 다음과 같은 모델을 사용이 가능하다
- MAI-Image 2.5
- MAI-Transcribe 1.5
- MAI-Voice 2
그외 실험적 기능 몃가지도 시현한다
- Duo AI: AI모델 2개를 켜놓고 3자 대면하는 컨셉으로 대화를 나눌수 있는 모드다.
[1] 2026년 빌드에서 공개한 최신 모델인 MAI-1 thinking 도 매개변수가 35B정도 될정도로 컴팩트하다.