מה זה בעצם#
Voicebox היא תוכנה שמתקינים על המחשב ועושה שלושה דברים: מייצרת קריינות מטקסט בקול שאתם בוחרים, כולל שכפול הקול שלכם מדגימה קצרה; מתמללת דיבור להכתבה בכל אפליקציה; ונותנת לסוכני AI כמו Claude לדבר אליכם בקול. הכול רץ על המעבד והכרטיס מסך שלכם, בלי חשבון ובלי לשלוח את הקול לשרת של מישהו אחר.
עד היום את שני הדברים הראשונים שכרתם. קריינות בקול אנושי נעשית ברובה ב-ElevenLabs, והכתבה חכמה ב-Wispr Flow. שניהם כלים מצוינים, ושניהם במנוי חודשי. הפרט שהכי כדאי לשים לב אליו: ב-ElevenLabs שכפול קול לא קיים בתוכנית החינמית בכלל. הוא מתחיל במדרגה בתשלום. כלומר הפיצ'ר שבגללו רוב האנשים מגיעים הוא בדיוק זה שנמצא מעבר לקופה.
Voicebox היא הגרסה החינמית בקוד פתוח. ריפוזיטורי בגיטהאב תחת רישיון MIT, עם 50.2 אלף כוכבים ומעל שני מיליון הורדות. מתקינים אותה כמו כל תוכנה: מורידים קובץ, פותחים, ומשתמשים.
זו לא הרחבה לדפדפן ולא שירות ענן
Voicebox היא אפליקציית דסקטופ מלאה למק, ווינדוס ולינוקס. המודלים יורדים למחשב שלכם פעם אחת ורצים מקומית אחרי זה. זה אומר שהיא עובדת גם בלי אינטרנט, וזה גם אומר שהיא צורכת מקום בדיסק ועובדת מהר יותר ככל שהמחשב חזק יותר.
כמה זה עולה, בכנות#
| | ElevenLabs | Wispr Flow | Voicebox |
| קריינות מטקסט | כן | לא | כן |
| שכפול הקול שלכם | לא קיים בחינמי | לא | כן, חינם |
| הכתבה לכל אפליקציה | לא | כן | כן |
| מה החינמי נותן | 10,000 קרדיטים בחודש, בלי שכפול | 2,000 מילים בשבוע | הכול |
| עלות חודשית אמיתית | מ-6 דולר, ריאלית 22 | 12 עד 15 דולר | 0 |
| איפה הקול שלכם יושב | בענן שלהם | בענן שלהם | על הדיסק שלכם |
| עובד בלי אינטרנט | לא | לא | כן |
דף התמחור של Voicebox אומר את זה בשורה אחת: "The app is free. Forever." יש שם גם מדרגות בתשלום, אבל הן על גיבוי וסנכרון בענן, הן מסומנות "בקרוב", והן לא נוגעות בשום דבר שמתואר במדריך הזה.
מה שכן עולה זה מקום בדיסק וזמן. כל מודל שאתם מתקינים יורד פעם אחת ותופס בין כמה מאות מגה לכמה גיגה. ומחשב חלש ייצר לאט יותר. זה כל המחיר.
למי זה מתאים, ולמי פחות#
זה מתאים לכם אם אתם מייצרים תוכן בקביעות ומשלמים על קריינות, או מקלידים הרבה ורוצים להכתיב במקום, או פשוט לא רוצים שהקול שלכם ישב אצל ספק חיצוני.
מתי לא לטרוח
אם אתם צריכים קריינות אחת בשנה, המנוי החינמי של ElevenLabs יספיק לכם ולא שווה להוריד מודלים. ואם המחשב שלכם ישן וחלש, הייצור יהיה איטי מספיק כדי להרגיז. Voicebox משתלמת כשמשתמשים בה הרבה.
האם זה עובד בעברית#
זו השאלה הראשונה, אז נענה אותה מיד: כן, אבל רק במנוע אחד מתוך השבעה.
Voicebox לא מגיעה עם מנוע קריינות אחד אלא עם שבעה, ואתם בוחרים איזה להתקין. הם לא זהים בשפות שהם יודעים:
| מנוע | שפות | עברית |
| Chatterbox | 23 | כן |
| Qwen3-TTS | 10 | לא |
| Qwen CustomVoice | 10 | לא |
| TADA | 10 | לא |
| Chatterbox Turbo, LuxTTS, Kokoro | מצומצם | לא |
המסקנה המעשית: אם אתם רוצים קריינות בעברית, תתקינו Chatterbox. עברית מופיעה במפורש ברשימת 23 השפות בכרטיס המודל של Resemble AI, מי שבנו אותו. אם תתקינו את Qwen3-TTS כי הוא הראשון ברשימה ותנסו להקריא עברית, תקבלו תוצאה מבולבלת ותחשבו שהתוכנה שבורה. היא לא, פשוט בחרתם מנוע שלא מדבר את השפה.
להכתבה בעברית המצב טוב יותר
ההכתבה עובדת על Whisper, ו-Whisper יודע 99 שפות בכל אחד מהגדלים שלו, כולל עברית. כלומר גם אם הקריינות בעברית מוגבלת למנוע אחד, ההכתבה בעברית עובדת בלי התניות.
ההתקנה, שלב אחרי שלב
1 להוריד את התוכנה
נכנסים ל-voicebox.sh ולוחצים DOWNLOAD. האתר מזהה את מערכת ההפעלה ונותן את הקובץ הנכון: DMG למק, MSI לווינדוס, ויש גם לינוקס ו-Docker. פותחים ומתקינים כרגיל.
2 להתקין מודל קריינות אחד לפחות
התוכנה מגיעה ריקה ממודלים בכוונה, כדי לא להוריד גיגהבייטים שלא תשתמשו בהם. נכנסים ל-Settings, לאזור המודלים, ומורידים.
לעברית: Chatterbox. לאנגלית בלבד ואם אתם רוצים את האיכות הגבוהה ביותר עם שליטה בטון ובקצב: Qwen3-TTS. אם המחשב חלש ואתם רוצים משהו שרץ מהר על מעבד בלבד: LuxTTS או Kokoro, שהוא 82 מגה בלבד.
3 להתקין Whisper, רק אם רוצים הכתבה
הכתבה דורשת מודל תמלול נפרד. Whisper מגיע בחמישה גדלים: Base ב-74 מגה, Small ב-244, Medium ב-769, Large ב-1.5 גיגה ו-Turbo ב-809 מגה. כולם יודעים 99 שפות.
ההמלצה: Turbo. הוא גרסה מקוצצת של Large עם איכות כמעט זהה ופי שמונה מהירות, וזה בדיוק מה שצריך להכתבה בזמן אמת. אם אתם רק מקריאים ולא מכתיבים, אפשר לדלג על השלב הזה לגמרי.
לשכפל את הקול שלכם
1 Profiles, ואז Create Voice
עוברים ללשונית Profiles ולוחצים Create Voice. שם נותנים לפרופיל שם ומספקים דגימת קול.
2 שלוש דרכים להכניס דגימה
העלאת קובץ: גוררים כל קובץ אודיו, WAV, MP3, FLAC או WebM. אם יש לכם הקלטה ישנה באיכות טובה, זו הדרך הכי טובה.
הקלטה מהמיקרופון: מקליטים על המקום, עם תצוגת גל חיה. התקרה היא 30 שניות.
לכידת אודיו מהמערכת: משכפל קול ממה שמתנגן במחשב כרגע.
3 כמה להקליט
טכנית מספיקות שלוש שניות. מעשית, תכוונו ל-10 עד 30 שניות של דיבור רציף. דגימה של שלוש שניות תעבוד, אבל תיתן קול שנשמע שטוח, כי אין בה מספיק אינטונציה כדי ללמוד ממנה.
איכות הדגימה היא כל המשחק
שכפול קול הוא לא קסם, הוא חיקוי של מה שנתתם. חדר עם הד ייתן קול עם הד. מזגן ברקע ייתן רחש ברקע בכל קריינות שתייצרו אחר כך. תקליטו בחדר קטן עם רהיטים, קרוב למיקרופון, בלי מוזיקה ובלי אנשים מסביב. עשרים שניות נקיות עדיפות על שתי דקות בינוניות.
לייצר קריינות
עוברים ללשונית Generate, בוחרים את הפרופיל, מדביקים טקסט ולוחצים Generate. תוך שניות עד עשרות שניות, תלוי באורך ובמחשב, מקבלים קובץ שאפשר להאזין לו ולהוריד.
שני דברים ששווה לדעת על השלב הזה:
אין תקרת אורך מעשית. אפשר להזין עד 50,000 תווים בפעם אחת. התוכנה מפצלת את הטקסט בגבולות משפט, מייצרת כל חלק בנפרד ומחברת אותם עם מעבר חלק. זה אומר שפרק שלם של פודקאסט או פרק באודיובוק זה מכה אחת, לא עשרים.
ב-Qwen3-TTS אפשר לביים את הקריינות במילים. זה המנוע היחיד שמקבל הוראות מסירה: כותבים "לאט וחם" או "סמכותי וברור" והמסירה משתנה בהתאם. באנגלית זה חזק מאוד. בעברית אתם על Chatterbox, שאין לו את זה, אבל יש לו שליטה בעוצמת הרגש.
הכתבה במקום הקלדה
זה החלק שמחליף את Wispr Flow, והוא הכי פשוט להסבר: מחזיקים קיצור, מדברים, משחררים, והטקסט מופיע.
מחזיקים ⌘ ו-⌥ במק, או Ctrl ו-Alt בווינדוס
↓
מדברים בזמן שהקיצור לחוץ
↓
משחררים
↓
הטקסט נוחת בשדה שהסמן נמצא בו, בכל אפליקציה
זה עובד בוואטסאפ ווב, בג'ימייל, בוורד, בשדה חיפוש, בכל מקום שאפשר להקליד בו. אין אינטגרציה להגדיר, כי זה פשוט מדמה הקלדה.
ליטוש אוטומטי של התמלול. יש אפשרות להפעיל מודל שפה מקומי, Qwen3, שמנקה את התמלול לפני שהוא נוחת: מוריד "אהה", מתקן תיקונים עצמיים ומסדר פיסוק, בלי לנסח מחדש. "אז כאילו אני חושב שנעלה את זה ביום שישי, לא רגע, שלישי" הופך ל"אני חושב שנעלה את זה ביום שלישי". זה אופציונלי, וגם הוא רץ מקומית.
לתת ל-Claude קול
זה החלק שרוב האנשים לא מגלים, והוא הסיבה הכי טובה להתקין את זה אם אתם כבר עובדים עם סוכני AI.
Voicebox מריצה שרת מקומי, ואפשר לחבר אליו כל סוכן שמדבר MCP: Claude Code, Cursor, Cline. מוסיפים בלוק אחד לקובץ ההגדרות של הסוכן:
{
"mcpServers": {
"voicebox": {
"url": "http://127.0.0.1:17493/mcp"
}
}
}
מרגע זה יש לסוכן כלי בשם voicebox.speak, והוא יכול לדבר אליכם. בפועל זה אומר שאתם יכולים ללכת להכין קפה בזמן ש-Claude עובד, ולשמוע "הבדיקות עברו, מוכן למיזוג" במקום לחזור ולבדוק את המסך. אפשר לתת לכל סוכן קול אחר, כדי לדעת מי מדבר בלי להסתכל.
למי שלא עובד עם MCP יש גם REST רגיל על אותה כתובת, למשל POST /generate לייצור קריינות ו-POST /speak להשמעה. אין מפתח API, אין הגבלת קצב ואין תשלום לפי תו, כי הכול רץ אצלכם. התיעוד המלא זמין ב-http://127.0.0.1:17493/docs כשהתוכנה פועלת.
חמישה כשלים שקטים
- התקנתם מנוע שלא מדבר עברית. הכשל הנפוץ ביותר. מתקינים את Qwen3-TTS כי הוא ראשון ברשימה, מזינים עברית, ומקבלים ג'יבריש. הפתרון הוא Chatterbox, ואין דרך לעקוף את זה.
- הדגימה הוקלטה בחדר עם הד. כל קריינות שתייצרו אחר כך תישא את ההד. זה לא מתוקן בהגדרות, זה מתוקן בהקלטה מחדש.
- ההכתבה לא עובדת כי לא הותקן Whisper. מודל הקריאה ומודל התמלול הם שני דברים נפרדים. התקנתם את הראשון, ההכתבה עדיין תשתוק.
- הכתבה בעברית שנוחתת באנגלית. אם שפת התמלול לא הוגדרה נכון בהגדרות, Whisper מנחש, ולפעמים מנחש לא נכון. קובעים את השפה במפורש.
- הייצור איטי כי המודל גדול מדי למחשב. אם התקנתם את המודל הכי גדול על מחשב בינוני, כל משפט ייקח נצח. תרדו גודל. ההבדל באיכות קטן בהרבה מההבדל בזמן.
מילה על שכפול קול של אנשים אחרים
Voicebox יודעת לשכפל כל קול, כולל קול שלכדתם מסרטון יוטיוב. זה אומר שקל מאוד לייצר קריינות בקול של מישהו שלא ביקשתם ממנו רשות.
אז שתי שורות ברורות. הקול שלכם שלכם, תעשו איתו מה שבא לכם. קול של אדם אחר, גם אם הוא מפורסם, הוא לא חומר גלם חופשי. שימוש מסחרי בקול של אדם מזוהה בלי הסכמה חושף אתכם לתביעה, ואם זה נשמע אמיתי מספיק כדי לבלבל מישהו, זו כבר התחזות. אם אתם מייצרים תוכן ללקוח, הכי פשוט להקליט את הלקוח.
מגבלות שכדאי להכיר לפני שמתחילים
עברית מוגבלת למנוע אחד. זו המגבלה הכי משמעותית לקהל ישראלי. Chatterbox עובד, אבל אין לכם שבע אפשרויות לבחור מהן, יש לכם אחת.
זה תלוי בחומרה שלכם. שירות ענן נותן את אותה מהירות לכולם. כאן, מק עם שבב M חדש יעבוד מהר, ומחשב בן שש שנים יעבוד לאט. זה המחיר של "רץ אצלכם".
המודלים תופסים מקום. בין כמה מאות מגה לכמה גיגה לכל מודל. אם הדיסק צפוף, תתקינו רק את מה שאתם באמת צריכים.
אין סנכרון בין מכשירים. הפרופילים והקבצים יושבים על המחשב שהתקנתם עליו. זה בדיוק מה שהמדרגה בתשלום אמורה לפתור, והיא עדיין לא יצאה.
שורה תחתונה
אם אתם מייצרים תוכן בעברית ורוצים קריינות בקול שלכם, Voicebox עם Chatterbox נותנת לכם את זה בחינם, על המחשב שלכם, בלי מנוי ובלי תקרה. אם אתם מקלידים הרבה, ההכתבה לבדה מצדיקה את ההתקנה. ואם אתם כבר עובדים עם Claude Code, לתת לו קול לוקח שתי דקות ומשנה את איך שמרגיש לעבוד מולו.
מה שזה לא: לא קסם שמייצר קול מושלם מדגימה גרועה, ולא פתרון למי שצריך קריינות פעם ברבעון. זה כלי למי שמשתמש בו הרבה, ובדיוק שם הוא חוסך הכי הרבה.