Meta가 8월 10일 공개한 Muse Glimmer는 개인 컴퓨터에서 실행하는 AI 에이전트를 겨냥한 30B급 모델입니다. Meta Superintelligence Labs가 개발했으며, 가중치는 Apache 2.0 라이선스로 공개했습니다. 9월 10일 현재 공식 Hugging Face 저장소에서 원본 모델과 로컬 실행용 GGUF 파일을 확인할 수 있습니다. 짧은 질문에 답하는 용도를 넘어, 도구를 호출하고 여러 단계의 작업을 이어가는 능력에 초점을 맞췄습니다.
Glimmer를 로컬에서 실행하면 데이터 처리 방식도 달라집니다. 개인 문서나 화면을 다루는 작업에서 모델을 내 컴퓨터에 두면, 모델의 답변을 만들기 위해 매번 외부 추론 서버에 요청할 필요가 줄어듭니다. 다만 로컬 모델에 인터넷 검색이나 외부 서비스 도구를 연결하면 그 도구는 별도로 통신합니다. 모델을 어디서 실행하는지와 연결된 앱이 데이터를 어디로 보내는지는 구분해서 볼 부분입니다.
Muse Spark의 능력을 개인 컴퓨터로 가져오는 방식
Meta는 Glimmer를 Muse Spark의 출력을 활용해 증류했다고 설명합니다. 증류는 더 큰 모델의 응답과 예측 정보를 학습에 사용해 작은 모델에 능력을 전달하는 방식입니다. 여기에 긴 문맥과 에이전트 작업을 위한 추가 학습, 지도 미세 조정과 강화 학습 등을 적용했습니다. 목표는 소비자용 하드웨어에서도 여러 단계로 추론하고, 도구를 쓰다 실패하면 작업을 다시 이어갈 수 있는 모델을 만드는 것입니다.
모델이 도구 사용을 학습했다는 사실만으로 컴퓨터의 모든 프로그램을 곧바로 조작할 수 있는 것은 아닙니다. 실제 작업에는 모델을 실행할 프로그램과 도구 연결, 파일 접근 권한 같은 주변 구성이 필요합니다. 예를 들어 문서에서 정보를 찾는 에이전트를 만든다면 Glimmer의 응답 능력에 파일을 읽는 도구와 검색 결과를 전달하는 처리를 붙여야 합니다. 공개 가중치는 개발자가 이런 구성을 직접 만들거나 바꿔 볼 수 있는 출발점입니다.
16.8GB 파일 하나와 실행 메모리는 다르다
공식 GGUF 저장소에는 16.8GB와 19.7GB의 텍스트 모델 파일이 올라와 있습니다. 저장소는 작은 빌드를 24GB VRAM 환경의 시작점으로, 큰 빌드를 32GB VRAM 환경을 위한 더 높은 품질의 선택지로 안내합니다. 양자화로 가중치의 표현 정밀도를 줄여, 원본보다 적은 메모리로 실행하도록 만든 파일들입니다.
이미지를 입력하려면 1.4GB의 이미지 인코더가 별도로 필요합니다. 텍스트 파일만 내려받으면 이미지 입력까지 자동으로 준비되는 구조가 아닙니다. 생성 속도를 높이는 DFlash를 사용하려면 1.6GB의 보조 모델도 더합니다. 저장소가 제시한 대략적인 실행 메모리는 작은 빌드의 텍스트만 쓸 때 약 17GB, 이미지 인코더를 더하면 약 19GB, 보조 모델까지 쓰면 약 20GB입니다. 큰 빌드는 같은 순서로 약 20GB, 22GB, 23GB를 제시합니다.
이 수치는 가중치와 작업용 문맥을 포함한 대략적인 안내입니다. 대화를 얼마나 길게 유지하는지, 요청을 몇 개씩 처리하는지에 따라 필요한 메모리가 달라질 수 있습니다. 24GB라는 숫자만으로 모든 설정에서 최대 문맥을 사용할 수 있다고 읽기는 어렵습니다. 실제 설치에서는 선택한 파일뿐 아니라 실행 중 사용하는 문맥과 이미지 처리 구성까지 함께 봐야 합니다.
속도 수치에는 보조 모델과 실행 조건이 붙는다
Meta의 모델 카드는 DFlash를 켰을 때의 생성 속도를 별도로 공개합니다. DFlash는 작은 보조 모델이 여러 토큰을 먼저 제안하고 주 모델이 이를 검증하는 방식입니다. 주 모델이 다음 토큰을 하나씩 계산하는 과정을 줄여 생성 속도를 높입니다. 이를 쓰려면 앞서 본 보조 모델의 메모리도 확보해야 합니다.
공개 표에서 RTX 5090은 기본 실행 초당 74.9토큰에서 DFlash 사용 시 233.4토큰으로, M4 Max는 23.7토큰에서 37.8토큰으로, M5 Max는 26.6토큰에서 50.2토큰으로 올라갔습니다. Meta가 여러 프롬프트로 측정한 결과이며, 배치 크기는 1, 디코딩 방식은 그리디입니다. Mac 측정에는 ExecuTorch를, RTX 측정에는 llama.cpp를 사용했습니다.
이 표는 같은 장치에서 가속 기능을 켜기 전후의 차이를 보여 줍니다. 실행 소프트웨어까지 다른 장치들의 성능을 그대로 비교하거나, 긴 문서를 읽고 도구를 여러 번 호출하는 전체 작업 시간으로 바꿔 읽을 수는 없습니다. 에이전트가 일을 끝내는 시간에는 문맥 처리와 검색, 도구 실행, 재시도도 들어갑니다. 빠른 텍스트 생성이 어떤 업무에서 도움이 되는지는 이 과정에서 드러납니다.
이미지를 읽지만 음성 대화 모델은 아니다
Glimmer의 모델 카드는 텍스트와 이미지를 입력받고 텍스트를 출력한다고 명시합니다. 문맥 길이는 131,072토큰 이상으로 표기돼 있습니다. 화면이나 사진을 함께 전달해 글로 설명받는 작업을 구성할 수 있지만, 오디오 입력과 출력은 지원하지 않습니다. 영상도 개별 프레임을 이미지로 전달할 수 있을 뿐, 영상 처리에 특화해 최적화한 모델은 아니라고 설명합니다.
Meta는 학습에 100개가 넘는 언어를 사용했다고 밝혔습니다. 모델 카드는 학습한 모든 언어를 동일하게 평가한 것은 아니며, 언어에 따라 품질이 떨어질 수 있다고 덧붙입니다. 한국어 문서에 쓰려는 경우에도 언어 수 자체보다 자신의 문서에서 고유명사와 수치, 문장 간 관계를 얼마나 정확히 유지하는지가 더 직접적인 판단 근거가 됩니다.
현재 로컬 실행을 준비한다면 공식 GGUF 저장소의 파일 구성과 실행 안내에서 시작할 수 있습니다. 메모리가 충분한 개발자는 이미지 입력과 가속 기능을 함께 시험할 수 있고, 텍스트 작업이 중심이라면 필요한 구성부터 좁혀 볼 수 있습니다. Glimmer가 제공하는 선택지는 개인 컴퓨터에서 쓸 수 있는 가중치와 이를 실행할 구체적인 파일입니다. 어떤 문서와 도구를 연결해 실제 업무를 맡길지는 그 위에서 결정됩니다.

GPT-6 Astra 업무용 공개, ChatGPT Work·Codex·API에 적용
OpenAI가 GPT-6 Astra의 업무 적용 사례와 기업용 제어 기능을 공개했습니다. 9월 3일 모델 발표와 9월 9일 업무용 발표의 차이, ChatGPT Work·Codex·API에서 확인할 조건을 정리합니다.

Claude Fable 5.1 공개, 일반 제공과 Mythos 5.1 제한 접근의 차이
Anthropic이 Claude Fable 5.1과 Mythos 5.1을 발표했습니다. 같은 기반 모델에 서로 다른 안전장치를 적용했으며, Fable은 일반 제공되고 Mythos는 검증된 조직에만 제한적으로 제공됩니다.

