מה זה "מצב חשיבה" במודלים של AI, ולמה זה משפיע על מהירות התגובה
מודל AI שחושב לפני שהוא עונה יכול לקחת פי 20 יותר זמן ממודל שעונה מיד. מה זה בעצם מצב חשיבה, מאיפה ההבדל במהירות, ולמה כל חברת AI קוראת לזה משהו אחר.

אם פתחתם את ChatGPT לאחרונה, שמתם לב שיש שם תפריט שנקרא "Intelligence" עם אפשרויות כמו Instant, Medium ו-High. זה לא עיצוב חדש שבא להיראות מגניב. זה מצב חשיבה, ה-Thinking Mode שכולם מדברים עליו, רק עם שם אחר. וזו כבר הפעם השנייה שהתפריט הזה מחליף שם.
מודל AI שנכנס למצב חשיבה יכול לקחת פי 10 ואפילו פי 20 יותר זמן לענות, לעומת מודל בלי מצב חשיבה. זה לא באג. זו בדיוק העבודה שהוא עושה. הפוסט הזה מסביר מה קורה בפועל מאחורי הקלעים, ומתי זה שווה את הזמן. וזה בדיוק ההבדל שתיארנו בפוסט הקודם שלנו על זמן תגובה של סוכן AI: 23 שניות מול 4.
מה זה בעצם "מודל חשיבה" (Reasoning Model)
מודל שפה רגיל, מהסוג שמפעיל את רוב סוכני בוואטסאפ היום, מקבל שאלה ופולט תשובה מילה-מילה בלי לתכנן קדימה. זה עובד מצוין ברוב המקרים, אבל בשאלות מורכבות הוא נוטה לפספס שלבים או לקפוץ למסקנה מהר מדי.
מודל חשיבה עובד אחרת. לפני שהוא כותב את התשובה שאתם רואים, הוא מייצר "שרשרת חשיבה" (chain of thought), מעין טיוטה פנימית: הוא כותב לעצמו שלבי היגיון, מנסה להבין את המטרה הסופית שלכם, בודק אפשרויות, מתקן את עצמו, ורק אז מגיע לתשובה הסופית. אפשר להגיד שהוא כותב לעצמו פרומפטים ועונה לעצמו כדי לתת תשובה מדוייקת וחכמה יותר. חלק מהמודלים מציגים את השרשרת הזו למשתמש, וחלק מסתירים אותה ומראים רק את הסיכום בסוף.
רגע, מאיפה זה בכלל הגיע?
עד סוף 2024, כל מודלי השפה הגדולים בעצם עבדו באותו אופן: מקבלים שאלה, פולטים תשובה. אז בספטמבר 2024 OpenAI השיקה את סדרת o1, שהייתה הראשונה שהוצגה במפורש כ"מודל חשיבה". הרעיון עצמו של שרשרת חשיבה היה מוכר מ-2022 כטכניקת פרומפט, אבל o1 הייתה הפעם הראשונה שאומנה מלכתחילה לחשוב לפני שהיא עונה.
מאז זה הפך לסטנדרט. אנתרופיק הוסיפה "Extended Thinking" ל-Claude 3.7 בפברואר 2025, גוגל השיקה "Gemini Flash Thinking", ומודלים חופשיים יותר כמו DeepSeek-R1, Qwen, וחבריהם, הראו שאותו רעיון עובד גם בקוד פתוח. היום כמעט לכל חברה גדולה יש גרסת "חשיבה" של המודלים שלה, בכינויים שונים.
למה זה לוקח יותר זמן (וגם עולה יותר)
לפי מדידה של Artificial Analysis, מודלי חשיבה צורכים עד פי 20 טוקנים לעומת מודל שעונה בלי שלב חשיבה. אצל Claude 3.7 Sonnet במצב Thinking עם תקציב של 64 אלף טוקנים, המדידה הראתה פי 15.

טוקנים הם היחידה שבה מודל AI "חושב" וכותב, וכל טוקן עולה כסף וזמן עיבוד. שרשרת חשיבה ארוכה יכולה להכיל אלפי טוקנים שהמשתמש בכלל לא רואה, לפני שמגיעה התשובה הסופית הקצרה. זו הסיבה הישירה לזמן התגובה הארוך יותר.
זה בדיוק מה שקרה לנו במקרה שתיארנו בפוסט על מקרה בוחן אמיתי: כשהשתמשנו במודל חשיבה כדי לחלץ מידע מליד בוואטסאפ, זמן התגובה עלה לכ-23 שניות בממוצע. אחרי שעברנו למודל מהיר בלי מצב חשיבה לצד עוד שיפורים שהרחבנו עליהם בפוסט, זה ירד לכ-4 שניות.
3 מצבים, 3 זמני תגובה

התרגום המעשי: Instant מיועד לשליפות ותשובות מהירות, Thinking מיועד לבעיות מרובות-שלבים כמו סקירת קוד או תכנון, ו-Pro מיועד למשימות שבהן דיוק חשוב יותר מזמן, כמו מחקר או חישוב פיננסי מורכב, לדוגמה המודל Gemini 1.5 Pro. ככל שנותנים למודל יותר "מרחב חשיבה", הוא לוקח יותר זמן, וזה בדיוק העניין.
איך כל חברת AI קוראת לזה (וכן, זה משתנה כל הזמן)
ל-OpenAI כבר היו שלושה שמות שונים לאותו רעיון. בגרסה מוקדמת יותר קראו לזה "Quick Response" מול "Think Deeper". אחר כך זה הפך ל-"Instant", "Thinking" ו-"Pro". ובגרסה העדכנית, הכל התכנס לתפריט אחד שנקרא "Intelligence", עם רמות Instant, Medium ו-High.

זה כנראה לא השם האחרון. חברות ה-AI עדיין מגששות איך להסביר את הרעיון הזה למשתמש הרגיל, ולכן סביר שהמינוח ימשיך להשתנות. אנתרופיק, החברה שמפתחת את קלוד, דווקא שמרה על שם עקבי יותר: "Extended Thinking", עם פרמטר שנקרא "thinking budget" שקובע כמה מרחב חשיבה לתת למודל. Claude מציגה יכולת שליטה ברמת החשיבה שונה עם סליידר שמביא למשתמש אפשרות לבחור בין Faster לבין Ultracode, וסה”כ מדובר ב-6 שלבים. גוגל, מהצד שלה, מציעה גרסאות "Thinking" למודלי Gemini שלה.
המסקנה המעשית: אל תתחברו לשם, תתחברו למה שהוא עושה. בכל כלי שיש בו אפשרות כזאת, השאלה האמיתית היא לא "מה כתוב על הכפתור", היא "כמה זמן אני מוכן לתת למודל לחשוב על השאלה הזו", ואפילו יותר חשוב “מה רמת החשיבה הנדרשת למשימה הנוכחית”.
מתי כדאי להשתמש במצב חשיבה, ומתי הוא רק מבזבז זמן וטוקנים
מצב חשיבה שווה את הזמן שלו כשהמשימה כוללת כמה שלבי היגיון שקשה לפספס: ניתוח משפטי, חישוב פיננסי מדויק, תכנון מורכב, סקירת קוד. במקרים האלה המודל בונה תשובה אמינה יותר, פשוט כי הוא בודק את עצמו בדרך.
אבל בשיחה שצריכה להישאר שיחה, כמו לקוח שכותב בוואטסאפ ומצפה לתשובה עכשיו, מצב חשיבה הוא בעיה, לא יתרון. אף לקוח לא מרגיש שהוא מקבל שירות טוב יותר רק כי חיכה 23 שניות למחיר, גם אם המודל "חשב" עליו לעומק.
המודל הכי חכם בעולם לא שווה הרבה אם הלקוח כבר עזב את הוואטסאפ עד שהוא סיים לחשוב.
מדריך החלטה מהיר
אם אתם צריכים לבחור בין השניים, ככה זה מתחלק בפועל:
- מודל מהיר (Instant): מענה ללקוחות בוואטסאפ, סיכום מייל, שאילתה קצרה על מסמך, כתיבה מחדש של משפט, סיווג הודעה כליד או לא ליד.
- מודל חשיבה (Thinking): חישוב חשבונאי מדויק, ניתוח חוזה, פתרון בעיה טכנית עם כמה שלבים, קבלת החלטה עסקית שדורשת שקילת אפשרויות.
מה זה אומר לעסק שלכם
אם יש לכם סוכן AI שעונה ללקוחות, או שאתם שוקלים לבנות אחד, אלו שאלות שכדאי לשאול את מי שבונה אותו: איזה מודל מריץ את הסוכן, ובאיזה מצב חשיבה הוא משתמש בכל שלב, האם לסוכן יש תקשורת ישירה מול לקוחות, ואם כן, באיזה אופן? וואטסאפ? מייל?
סוכן שצריך לענות מיד על שאלת "מה שעות הפעילות שלכם" ופתאום נתקע לעשרות שניות, זה כנראה מודל חשיבה שרץ במקום הלא נכון.
שאלות נפוצות
האם מודל חשיבה תמיד מדויק יותר?
לא בהכרח. במשימות פשוטות הוא לפעמים "חופר" יותר מהצורך ואפילו מסתבך יותר משהוא עוזר, תופעה שמוכרת בתעשייה בשם overthinking. היתרון שלו בולט בעיקר במשימות מרובות-שלבים, לא בכל שאלה.
אפשר לכבות מצב חשיבה?
כן, ברוב הכלים הצרכניים יש הגדרה(כמו זה שמופיע בצילום המסך למעלה) שמאפשר לבחור בין מענה מיידי לבין מענה עם חשיבה מורחבת. במוצרים שרצים על API, ההחלטה הזו נקבעת מראש על ידי מי שבנה את המוצר, וזה בא לידי ביטוי על ידי בחירת המודל.
למה חברות ה-AI משנות את השם של הפיצ'ר הזה כל כך הרבה?
כנראה כי מדובר במושג טכני שקשה להסביר בשם אחד פשוט. "Thinking" נשמע אנושי מדי, "Intelligence" נשמע כמו רמת חוכמה כללית, ושתי הגישות נכונות רק חלקית. סביר שההתאמות האלה יימשכו.
אנתרופיק (קלוד) קוראת לזה משהו אחר?
כן, "Extended Thinking", עם פרמטר "thinking budget" שקובע כמה מרחב חשיבה לתת למודל. השם הזה נשאר יחסית עקבי לעומת השינויים החוזרים ב-OpenAI.
איך יודעים אם סוכן ה-AI שלי משתמש במצב חשיבה בטעות?
הסימן הכי ברור הוא זמן תגובה שלא עומד ביחס למורכבות השאלה: שאלה פשוטה שלוקחת יותר מכמה שניות. אם זה קורה, שווה לבדוק עם מי שבנה את הסוכן איזה מודל רץ מאחורי הקלעים.
מתחת לכל השמות המתחלפים, זה עניין פשוט: מודל שחושב יותר, עונה יותר לאט. השאלה שצריך לשאול היא לא איך קוראים לזה החודש, אלא איזו מהירות המשימה שלכם באמת צריכה.
רוצים שגם העסק שלכם יעבוד על אוטומט?
נשמח להראות לכם איך סוכן AI אחד יכול לחסוך שעות עבודה בשבוע - בשיחה קצרה, בלי התחייבות.
דברו איתנו


