בשביל שמנוע AI יצטט עסק, צריך לקרות דבר אחד לפני הכול: הוא צריך לקבל את העובדות. לא לדרג אותן, לא לאהוב אותן — פשוט לקבל אותן בתוך הקובץ שהשרת שולח לו.

רצינו לדעת מה קורה בפועל בישראל, אז עשינו את הדבר הפשוט: התחזינו לזחלנים של ChatGPT, של Claude ושל Perplexity, ביקשנו חמישה אתרים ישראליים מוכרים, ומדדנו בדיוק מה חזר. בלי הערכות ובלי תיאוריה — מה שהשרת שלח.

התוצאה המרכזית: ברשת בתי מרקחת ארצית, עמוד הסניפים ששוקל 2.2 מגה־בייט לא מכיל אף סניף אחד. לא שם, לא כתובת, לא שעת פתיחה. הכול נטען אחרי שהדפדפן מריץ JavaScript — וזחלני ה־AI לא מריצים JavaScript.

מה בדקנו, ואיך

חמישה אתרים ישראליים גדולים מתחומים שונים: אופנה, פארם, מזון, אלקטרוניקה ומלונאות. את כולם ביקשנו שלוש פעמים, פעם אחת עבור כל אחד מהזחלנים המרכזיים — GPTBot, ClaudeBot ו־PerplexityBot — ומדדנו ארבעה דברים:

  • מה כתוב ב־robots.txt לגבי בוטי AI — מותר, אסור, או שאף אחד לא החליט.
  • איזה קוד תגובה השרת מחזיר לכל בוט (200? 403?).
  • האם התוכן העסקי קיים ב־HTML הגולמי, לפני שהופעל JavaScript כלשהו.
  • איזו סכמה (Schema.org / JSON-LD) יושבת בעמוד, ואילו סוגי ישויות היא מגדירה.

כל בדיקה היא בקשת HTTP רגילה שכל אחד יכול לחזור עליה — בסוף המאמר יש את הפקודות המדויקות. את שמות המותגים בחרנו לא לפרסם: הממצאים כאן הם על תופעה בשוק, לא על חברה מסוימת, והדפוסים שנמצאו חוזרים כמעט בכל אתר ישראלי שבדקנו מעולם.

ממצא 1: עמוד הסניפים שאין בו סניפים

ברשת בתי המרקחת, ביקשנו את עמוד הסניפים — בדיוק העמוד שאמור לענות על "מה שעות הפתיחה של הסניף ב...". השרת החזיר 200, והעמוד שקל 2,194,160 תווים. נשמע כמו הרבה מידע.

רוצים להריץ את אותה בדיקה על האתר שלכם?

את מה שעשינו כאן ידנית על חמישה אתרים אפשר להריץ עכשיו על כל אתר בלחיצה — מה בדיוק זחלן AI מקבל, ומה הוא מפספס.

לבדיקה חינמית ←

ואז ספרנו מה יש בפנים:

  • שמות סניפים: 0
  • שעות פתיחה בפורמט של שעה: 0
  • סכמת LocalBusiness או OpeningHoursSpecification: 0

העמוד בנוי כאפליקציית JavaScript. בדפדפן שלכם הוא נראה מצוין — הרשימה נטענת משרת נתונים תוך שנייה. אבל הזחלן לא מריץ JavaScript: הוא מקבל את השלד, ובשלד אין סניפים. מבחינת מנוע ה־AI, לרשת הזאת אין סניפים.

ממצא 2: אף אחד לא קיבל החלטה לגבי בוטי AI

בדקנו את קובץ ה־robots.txt של כל האתרים שהיו נגישים, וחיפשנו אזכור כלשהו של GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot, Google-Extended או CCBot.

אפס אזכורים. בכל האתרים.

זה לא אומר שהם חסומים — היעדר כלל הוא היתר. זה אומר משהו אחר: אף אחד לא ישב והחליט. הקובץ שמנהל את הגישה של מנועי ה־AI לעסק נכתב בשלב אחר לגמרי, ומאז לא נגעו בו. זו לא בעיה בפני עצמה, אבל היא מלמדת עד כמה השכבה הזאת עדיין לא על הרדאר.

ממצא 3: שניים מחמישה פשוט לא ענו

שני אתרים החזירו 403 Forbidden — כלומר "אסור לך" — לכל בקשה שלנו. חשוב לדייק כאן, כי קל לטעות: הם החזירו 403 גם כשביקשנו עם User-Agent של דפדפן רגיל. כלומר זו לא חסימה שמכוונת נגד בוטי AI, אלא מערכת הגנה (WAF) שחוסמת תעבורה אוטומטית מכתובות IP של שרתים.

ולמה זה בכל זאת רלוונטי? כי הזחלנים של מנועי ה־AI מגיעים בדיוק מאותו סוג של כתובות — שרתים בענן, לא בתים פרטיים. מערכת שחוסמת "תעבורה חשודה" באופן גורף עלולה לחסום גם אותם. מבחוץ אי אפשר לדעת אם הזחלנים הלגיטימיים ברשימה הלבנה או לא. זו שאלה שרק מי שיש לו גישה ללוגים של השרת יכול לענות עליה — ומעט מאוד עסקים חשבו לבדוק.

ממצא 4: הסכמה שקיימת היא ברירת המחדל של המערכת

בשלושת האתרים שכן ענו לנו מצאנו סכמה — וזו חדשה טובה. אבל כשמסתכלים מה בדיוק היא מגדירה, התמונה חוזרת על עצמה: Organization ו־WebSite. זהו. זו בדיוק הסכמה שכל מערכת ניהול תוכן או תוסף SEO מייצרים אוטומטית — שם החברה, הלוגו, וכתובת האתר.

מה שלא מצאנו באף אחד מהעמודים שבדקנו: Product עם מחיר, LocalBusiness עם שעות פתיחה, FAQPage עם שאלות ותשובות, או Service עם תיאור שירות. כלומר — בדיוק העובדות שלקוח שואל עליהן מנוע AI.

אתר אחד בלט לטובה עם ContactPoint ו־PostalAddress מלאים, ואחר סימן יפה את פיד הרשתות החברתיות שלו. אבל התבנית הכללית ברורה: הסכמה מספרת למכונה מי החברה, ולא מה היא מוכרת, בכמה, ומתי היא פתוחה.

למה זה קורה — ההסבר הטכני בשתי שורות

זחלני ה־AI המרכזיים — GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot — מורידים את קובץ ה־HTML ומנתחים אותו כטקסט. הם לא מריצים JavaScript. מחקר שבדק מאות מיליוני בקשות מצא שהם אפילו מורידים קבצי JavaScript — ופשוט לא מפעילים אותם.

המשמעות פשוטה: כל מה שנטען אחרי טעינת העמוד — רשימות סניפים, מחירים דינמיים, ביקורות, טאבים שנפתחים — פשוט לא קיים מבחינתם. ובניגוד לגוגל, שיש לה גל רינדור שני שמריץ JavaScript, למנועי ה־AI אין.

והנה החלק שרוב המדריכים מפספסים

עד כאן המסקנה המתבקשת היא "תוסיפו סכמה". וזה נכון — אבל לא מספיק, וכאן נמצא העדכון החשוב ביותר בתחום.

בבדיקה מבוקרת שפורסמה ב־2025 בדקו מה קורה כשעובדה מסוימת קיימת רק בתוך קוד הסכמה, בלי שהיא מופיעה כטקסט גלוי בעמוד. התוצאה: אף אחד ממנועי ה־AI שנבדקו — ChatGPT, Claude, Perplexity ו־Gemini — לא שלף אותה כשהוא ענה בזמן אמת. הם קראו את הטקסט הגלוי.

המסקנה המעשית היא ששתי השכבות צריכות להתקיים יחד:

  • הסכמה — כדי שהמנועים יבינו מי הישות, מה הקשרים בינה לבין הדברים, ואיך לשייך את העסק לתחום שלו. זו השכבה שנסרקת ונשמרת.
  • הטקסט הגלוי — כדי שהעובדה תישלף בפועל ברגע שמישהו שואל שאלה. זו השכבה שנקראת בזמן המענה.

עסק שיש לו רק סכמה — מובן אבל לא מצוטט. עסק שיש לו רק טקסט — מצוטט לפעמים, בלי שהמנוע באמת יודע מי הוא. הערך נמצא בשילוב, וכשהשתיים נבנות מאותו מקור, הן גם לא יכולות לסתור זו את זו.

תבדקו את עצמכם — חמש דקות, בלי כלים

אלה בדיוק הבדיקות שהרצנו. פתחו טרמינל והחליפו את הכתובת בשלכם:

# 1. מה השרת מחזיר לזחלן של ChatGPT?
curl -s -o /dev/null -w "%{http_code}\n" \
  -A "Mozilla/5.0 (compatible; GPTBot/1.2; +https://openai.com/gptbot)" \
  https://your-site.co.il/

# 2. האם מחיר/שעות קיימים ב-HTML הגולמי? (בלי JavaScript)
curl -s -A "Mozilla/5.0 (compatible; GPTBot/1.2)" \
  https://your-site.co.il/ | grep -c "₪"

# 3. איזו סכמה יש בעמוד?
curl -s https://your-site.co.il/ | grep -o '"@type":"[^"]*"' | sort | uniq -c

# 4. מה כתוב ב-robots.txt לגבי בוטי AI?
curl -s https://your-site.co.il/robots.txt | grep -iE "GPTBot|ClaudeBot|Perplexity"

איך לקרוא את התוצאות: אם בדיקה 1 מחזירה משהו שאינו 200 — יש בעיית גישה. אם בדיקה 2 מחזירה 0 והאתר מלא במחירים — המחירים נטענים ב־JavaScript ולא נראים לזחלן. אם בדיקה 3 מחזירה רק Organization ו־WebSite — יש לכם את ברירת המחדל של המערכת, לא סכמה עסקית.

מה עושים עם זה

לפי הסדר, מהזול ליקר:

  1. בדקו גישה. אם השרת חוסם זחלנים — כל השאר לא רלוונטי. זו בדיקת לוגים של חצי שעה מול מי שמנהל לכם את ההגנה.
  2. ודאו שהעובדות נמצאות ב־HTML. מחיר, שעות, כתובת, מדיניות — אם הן מגיעות אחרי JavaScript, הן לא קיימות מבחינת המנוע. לרוב זו החלטת פיתוח נקודתית, לא שכתוב אתר.
  3. הוסיפו סכמה עסקית אמיתית. לא Organization גנרי — אלא הישות, השירותים, המוצרים והשאלות הנפוצות, מקושרים בגרף אחד עם מזהים קבועים.
  4. דאגו שהעובדות יופיעו גם כטקסט. אותן עובדות, באותו עמוד, בפורמט שאדם קורא.

ודבר אחרון, שהוא אולי החשוב מכולם: לפני שאתם משנים משהו, תמדדו. שאלו את ChatGPT ואת Perplexity עשר שאלות שהלקוחות שלכם באמת שואלים — כמה עולה, איפה אתם, מה שעות הפתיחה — ותעדו את התשובות כפי שהן היום. בלי מדידת "לפני", לא תדעו אם משהו זז.

שורה תחתונה

חמישה אתרים גדולים, של מותגים מוכרים עם צוותים דיגיטליים רציניים. אחד מגיש עמוד סניפים בלי סניפים, שניים חוסמים תעבורה אוטומטית באופן שעלול לכלול את הזחלנים, ואף אחד לא הגדיר מדיניות לבוטי AI. הסכמה שקיימת מספרת מי החברה — ולא מה היא מוכרת.

זה לא כשל של מישהו. זו שכבה חדשה שנפתחה מהר יותר משהשוק הספיק להתארגן. מי שיסגור אותה עכשיו — יהיה המקור שהמנוע מצטט כשהמתחרה שלו עדיין בלתי נראה.

שאלות ותשובות

הבדיקה המהירה היא בקשה אחת לשרת עם ה־User-Agent של GPTBot ובדיקה שהתשובה היא 200 ולא 403. הבדיקה השנייה, החשובה יותר, היא לחפש בתוך ה־HTML הגולמי את העובדות עצמן — מחיר, שעות, כתובת. אם הן לא שם, הן לא קיימות מבחינת המנוע, גם אם הן מוצגות מצוין בדפדפן. שתי הבדיקות לוקחות חמש דקות ומופיעות במאמר עם הפקודות המדויקות.
כי הדפדפן מריץ JavaScript והזחלנים של מנועי ה־AI לא. כשאתם פותחים עמוד, הדפדפן מוריד שלד ואז מפעיל קוד שמביא את התוכן משרת נתונים. הזחלן עוצר בשלב הראשון. לכן עמוד שנראה מלא ומושלם למשתמש יכול להיות ריק לחלוטין מבחינת מנוע AI — כפי שמצאנו בפועל בעמוד סניפים ששוקל 2.2 מגה־בייט ולא מכיל אף סניף.
ייתכן. מערכות הגנה כמו Cloudflare או Imperva חוסמות תעבורה אוטומטית שמגיעה מכתובות IP של שרתים — וזחלני ה־AI מגיעים בדיוק משם. במחקר שלנו שני אתרים מתוך חמישה החזירו 403 לכל בקשה אוטומטית. מבחוץ אי אפשר לקבוע אם הזחלנים הלגיטימיים ברשימה הלבנה; זו בדיקת לוגים שרק בעל האתר יכול לעשות, והיא הדבר הראשון שכדאי לבדוק.
סכמה היא תנאי הכרחי, לא הבטחה. היא גורמת לעסק להיות מובן וניתן־לציטוט, אבל אף אחד לא יכול להתחייב שמנוע יצטט. בנוסף, בבדיקה מבוקרת מ־2025 נמצא שעובדה שקיימת רק בקוד הסכמה — בלי טקסט גלוי מקביל — לא נשלפה על ידי המנועים בזמן מענה. לכן צריך את שתי השכבות: סכמה וטקסט גלוי, מאותו מקור.
תלוי במה שבור. חסימת זחלנים היא שינוי הגדרה של שעה. העברת עובדות מ־JavaScript ל־HTML היא משימת פיתוח נקודתית, בדרך כלל ימים ולא שבועות. בניית סכמה עסקית מאומתת לאתר בגודל בינוני היא עבודה של שבוע, כולל אימות של כל עובדה מול האתר החי.

רוצים לדעת מה מנועי ה־AI מקבלים מהאתר שלכם?

אנחנו בונים סכמת AI ידנית, עמוד־עמוד, שבה כל עובדה מאומתת מול האתר החי לפני שהיא נכנסת לקוד — ומספקים גם את שכבת הטקסט הגלוי, מאותו מקור, כדי שהשתיים לא יוכלו לסתור זו את זו.

לתיאום שיחת התאמה קצרה ← לפרטים על השירות