דלגו לתוכן

מחקר של OpenAI מראה למה צ'טבוטים מנחשים לא נכון במבחני ההערכה הנוכחיים

רן מלמד8 בספטמבר 2025
  • המחקר מראה שהטיות הניקוד והאימון במבחני ההערכה גורמות למודלים לנחש בביטחון; שיטת ניקוד שמענישה טעויות ומשאירה ציון אפס ל"אני לא יודע/ת" מפחיתה שגיאות ומחזקת אמון.
  • המשמעות למשקיעים: אמון במערכות AI הוא קריטי ויכול לתמוך בהגדלת ההכנסות; TipRanks מציעה כלי השוואה להבנת מניות של חברות שמפתחות צ'טבוטים כמו ChatGPT.
מחקר של OpenAI מראה למה צ'טבוטים מנחשים לא נכון במבחני ההערכה הנוכחיים

עיקרי הדברים

  • המחקר קובע שהבעיה המרכזית בטעויות של צ'טבוטים נובעת מכללי האימון והניקוד במבחני ההערכה, לא מאופן הבנייה של המערכות. שיטת ניקוד שמענישה טעויות ומשאירה ציון אפס עבור "אני לא יודע/ת" יכולה להפחית שגיאות ולבנות אמון.
  • הדחף לענות גורם למודלים לנחש בביטחון ולהפיק "הזיות". עבור משקיעים, אמון במערכות בינה מלאכותית הוא קריטי ויכול לתמוך בהגדלת ההכנסות; TipRanks מציעה כלי השוואה לבחינת חברות שמפתחות צ'טבוטים דוגמת ChatGPT.

OpenAI, יחד עם ג'ורג'יה טק, פרסמה מחקר חדש שבוחן מקרוב למה צ'טבוטים ממשיכים לטעות. לפי המחקר, הבעיה השורשית אינה באופן שבו המערכות נבנות, אלא באופן שבו הן מאומנות ומקבלות ציונים. מבחני ההערכה הנוכחיים מדרגים תשובות כנכונות או שגויות, בלי לתגמל הודאה בחוסר ידע. כתוצאה מכך, מודלים כמו ChatGPT של OpenAI ו‑DeepSeek‑V3 לומדים לנחש בביטחון במקום לעצור כשלא בטוחים.

הצוות מראה שהזיות, או תשובות שגויות, מצייתות לאותם כללים מתמטיים כמו שגיאות מבחן פשוטות. למשל, אם עובדה מופיעה רק פעם אחת בנתוני האימון, המודל כמעט תמיד יתקשה בה בהמשך. בניסוי, אפילו מודלים מובילים נתנו כמה תאריכי לידה שגויים לאחד המחברים, במקום לומר שאינם יודעים. זה מדגים עד כמה הדחף לענות גובר על הדחף לעצור.

הפתרון המוצע ומה זה אומר על אמון

החוקרים מציעים שהפתרון טמון באופן שבו נותנים ציונים לתשובות. הם מציעים שיטה חדשה שמעניקה נקודות על תשובות נכונות, מורידה נקודות על תשובות שגויות, ומשאירה ציון אפס עבור "אני לא יודע/ת" ברור. בניסויים, מודלים שדילגו יותר על תשובות סיימו עם פחות טעויות בסך הכול, גם אם שיעור הדיוק שלהם נראה נמוך יותר על הנייר.

עבור משקיעים ומשתמשים, המחקר מדגיש שהבעיה של טעויות בבינה מלאכותית קשורה יותר לכללי האימון מאשר לפגמים חבויים. הוא גם מראה ששיטת ניקוד טובה יותר יכולה לבנות יותר אמון במערכות AI המשמשות בתחומים כמו פיננסים, בריאות ומשפט. אמון הוא מילת מפתח לכל מערכות ה‑AI. באופן טבעי, ככל שנבטח יותר בצ'טבוט ה‑AI, כך יגדל הפוטנציאל להגדיל את הכנסות החברה.

באמצעות כלי ההשוואה של TipRanks, ניתחנו כמה חברות מובילות שמפתחות צ'טבוטי AI דומים ל‑ChatGPT. ההשוואה זו לצד זו עוזרת למשקיעים להבין טוב יותר כל מניה וגם את שוק צ'טבוטי ה‑AI הרחב יותר.