בינה מלאכותית ביישום למבחן

ה-AI כותבת מבחנים. היא עדיין לא מחליטה אילו מהם לכתוב.

אנחנו מריצים את זה במשלוח כבר שנתיים, לא לצורך הדגמה. מה שהשתנה אינו אופי המקצוע: אלא היקף העבודה שהיועץ מספק ביום אחד.

לקבוע פגישה

היכן היא מדווחת

ארבעה שימושים, לפי סדר הרווחיות שנצפתה.

1 — הטיוטה הראשונה

יצירת מקרים מתוך מפרט או סיפור משתמש. היתרון אינו טמון באיכות הטקסט, אלא בכך שאיננו נאלצים להתחיל מדף ריק.

  • מקרים נומינליים ומקרים גבוליים מוצעים
  • יש לבצע תמיד הגהה אנושית

2 — תחזוקת נקודות העיגון

תיקון בורר שזז ממקומו לאחר שינוי עיצוב המסך. זו המשימה הכי לא מתגמלת בתחום האוטומציה, והכי מכנית.

  • פחות בדיקות "אדומות" לשווא
  • עלות התפעול האמיתית של בסיס אוטומטי

3 — מיון הכישלונות

להבחין בין תקלה בתוכנה לבין סביבה לא יציבה, ולקבץ חמישים מקרי כשל שיש להם אותה סיבה.

  • קמפיין אדום חוזר להיות ברור
  • משך הניתוח מתקצר משעתיים לעשר דקות

4 — השוואה המונית

להשוות אלפי ערכים למסמך ייחוס — תדריך, קטלוג או חוזה ממשק.

  • 25,704 השוואות בדקה אחת על צי רכבים אמיתי
  • במקום שבו האדם לוקח דגימות, המכונה מכסה את הכל

מה שהיא לא עושה

היא לא מחליטה דבר. וזה עניין מבני, לא זמני.

שלושה פסקי דין נותרו מחוץ להישג ידו, והם אלה שיש להם תוקף מחייב.

זה שווה בדיקה. ההחלטה בין כיסוי מסלול תשלום לכיסוי מסך ניהול מחייבת ידיעה מה החברה מפסידה בכל אחד מהמקרים. אף מודל אינו מכיר את הנתון הזה.

מה העלות של חריגה. תקלה בתצוגה במסך פנימי ותקלה זהה במסוף לקוח אינן בעלות אותה חשיבות. קביעת סדר העדיפויות היא החלטה עסקית.

אם גרסה מסוימת נכנסת לייצור. זוהי התחייבות, עם אחראי מוגדר. היא אינה מותנית בהסתברות כלשהי.

נוסיף מגבלה מעשית יותר: מודל מייצר תוצאות סבירות. במבחן, התוצאה הסבירה שהיא שגויה היא הגרוע ביותר שלא יהיה דבר — הוא יוצר אמון שאף בן אדם לא יפר. מכאן נובעת הכלל שלנו: כל מה שה-AI מייצר עובר קריאה חוזרת, וכל מה שלא עומד בדרישות נבדק ידנית לפני שהוא מוכרז כפגום.

בפועל

שנתיים של ייצור, לא ניסוי.

2 שנים
מיועד לשימוש במשלוחים, לא במעבדה
5 שניות
כדי לשחק שוב במסלול, לעומת 30 עד 50 דקות
756
פריטי מפה שנבדקו מחדש והושוו תוך דקה

התוצאה המעשית של זה: כיסוי שעובר מדגימה לכלל האוכלוסייה. מה שבדקנו במספר מסעדות, אנו בודקים כעת בכל הרשת — לא משום שהכלי חכם יותר, אלא משום שהוא אינו מתעייף ואינו מדלג על שורה 431.

שאלות ישירות

מה מבקשים מאיתנו

האם הבינה המלאכותית תחליף את בודקי התוכנה?

לא — ואנחנו במצב טוב לומר זאת, שכן אנחנו מפעילים את המערכת במשלוחים כבר שנתיים. היא מנסחת טיוטה ראשונה, מתחזקת את מסנני הבחירה, ממיינת את הכישלונות ומבצעת השוואות בהיקף נרחב. מה שראוי להיבדק, מה העלות של חריגה והאם גרסה מסוימת תועבר לייצור — כל אלה נותרים שיקולים סובייקטיביים. מה שכן השתנה הוא היקף הכיסוי.

האם הנתונים שלנו מועברים למודל ציבורי?

לא ללא הסכמתכם המפורשת, ובשום פנים ואופן לא כברירת מחדל. בהתאם למדיניות שלכם, אנו עובדים על משחקים אנונימיים, על מודל המארח אצלכם, או ללא בינה מלאכותית כלל באזורים רגישים. זוהי סוגיה שיש להכריע בה בשלב הגדרת המסגרת, ולא במהלך הדרך.

איך אפשר לדעת אם בדיקה שנוצרה היא תקינה?

באמצעות אותה בדיקה כמו במבחן שנכתב בכתב יד: האם ניתן לשחזר אותו, האם התשובה עליו היא בינארית, והאם הוא בודק משהו בעל ערך? מקרה שנוצר ואינו עומד בשלוש השאלות הללו נמחק, ואינו נשמר משום שאין בו תועלת.

מאיפה להתחיל בלי לערער את הכל?

באמצעות תחזוקת העוגנים ומיון הכישלונות: שני שימושים בלתי נראים למקצוע, שאינם מסכנים את האיכות, ומאפשרים לחסוך זמן כבר מהשבוע הראשון. יצירת המקרים מגיעה לאחר מכן, כאשר תהליך הבדיקה מחדש כבר פועל.

בואו נדבר על הדברים שאתם עדיין לא מצליחים לבדוק.

ביקורת ללא התחייבות על תהליך הבדיקות שלכם, כדי לדעת היכן אתם עומדים באמת.

לקבוע פגישה
he_ILHebrew