AI & Systems
Geek Rating 4.0 / 5.0
오프라인에서 100% 동작하는 나만의 AI 음성 전사(STT) 파이프라인
whisper.cpp와 Metal 가속을 활용해 음성 메모, 회의 녹음, 유튜브 영상을 맥북 로컬에서 30배속으로 텍스트화하는 자동화 파이프라인.
2026년 2월 18일1분 분량By GeekStory Team
AI, Whisper, LocalAI, macOS, Automation
오프라인에서 100% 동작하는 나만의 AI 음성 전사 파이프라인
외부 API(OpenAI Whisper API 등)를 사용하면 편리하지만, 사내 회의록이나 개인적인 메모를 전송할 때 데이터 프라이버시 문제가 늘 신경 쓰입니다. 또한 대용량 오디오를 처리할 때마다 누적되는 과금도 부담스럽습니다.
Apple Silicon(M시리즈) 맥북의 Metal 가속과 C/C++로 포팅된 whisper.cpp를 활용하면, 인터넷 연결이 전혀 없는 비행기 안에서도 실시간보다 훨씬 빠른 속도로 고품질 한국어 전사가 가능합니다.
1. 벤치마크 (M3 Max / Large-v3 모델 기준)
- 오디오 길이: 1시간 분량 회의 음성
- 처리 소요 시간: 약 1분 48초 (약 33배속 처리)
- VRAM 점유: 약 3.8GB
- 정확도: 전문 기술 용어 및 고유명사 포함 96.4% 수준
# whisper.cpp 빌드 (Metal 가속 활성화)
git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
cmake -B build -DGGML_METAL=ON
cmake --build build --config Release
# 한국어 large-v3 모델 다운로드
bash ./models/download-ggml-model.sh large-v3
# 전사 실행
./build/bin/whisper-cli -m models/ggml-large-v3.bin -l ko -f audio.wav -otxt -osrt
2. 자동화 파이프라인 연동
Raycast 또는 핫키 트리거와 연동해 단축키 하나로 마이크 입력을 녹음하고, 즉시 로컬 LLM이 요약하여 마크다운 파일로 저장하도록 구성해 두었습니다. 완벽한 프라이버시와 속도를 모두 만족하는 긱들의 필수 도구입니다.