
เทคโนโลยี
ของถูกที่ไม่ถูก
Jev ตัดสินใจเร็วกว่าและถูกกว่า LLM หลายสิบเท่า แต่ในการทดสอบคุมเบราว์เซอร์ มันทำงานสำเร็จแค่ราวหนึ่งในสาม ตัวเลขบอกว่ายังคุ้ม คำถามคืองานอีกราวสองในสามที่พลาดไป ใครเป็นคนจ่าย
เรื่อง Whale Andbooks · ภาพ Daisy Lovelace · 23 กันยายน 2026
5
96.5 กับ 37.3 คือเปอร์เซ็นต์ของงานที่ AI สองแบบทำสำเร็จ ในการทดสอบที่ Steve Sewell ผู้ร่วมก่อตั้ง Builder.io รันเองแล้วเอาผลมาโพสต์ งานในชุดทดสอบเป็นของที่คนทำบนเบราว์เซอร์กันทุกวัน คลิก เลือก เลื่อนหน้า กรอกฟอร์ม ค้นเที่ยวบินแล้วเลือกราคา ไปจนถึงจองโต๊ะร้านอาหารไทย
ตัวเลขแรกเป็นของ Luna ซึ่งทำงานแบบเดียวกับคน คือดูภาพหน้าจอแล้วตัดสินใจเองว่าจะคลิกตรงไหน ตัวเลขหลังเป็นของ Jev Ultrafast agent ที่ทีม Browser Use สร้างขึ้นบน Jev อีกตัวหนึ่งชื่อ Jev Browser ทำได้ 34.6 และในงานยาวแบบใช้จริงสิบงาน ตัวนั้นทำไม่สำเร็จเลยสักงาน สองตัวเลขแรกไม่ได้นับบนฐานเดียวกันเสียทีเดียว ฝั่ง Luna รวมงานบนเดสก์ท็อปอีกห้างานที่ฝั่ง Jev ไม่ได้วัด ถ้าดูเฉพาะงานง่ายบนเบราว์เซอร์ 42 งานที่ทุกตัวทำเหมือนกัน Luna ผ่านครบ 42 ส่วน Jev ทั้งสองตัวผ่าน 18
โมเดลที่ไม่ได้ถูกสร้างมาให้พูด
Jev ไม่ได้เขียนข้อความตอบกลับมาเหมือนแชตบอต TypeSafe AI บริษัทที่สร้างมัน เรียกมันว่า System One model คือรับสถานการณ์ตรงหน้าเข้าไป แล้วคืนคำตอบกลับมาเป็นตัวเลือกพร้อมความน่าจะเป็น ข้อนี้กี่เปอร์เซ็นต์ ข้อนั้นกี่เปอร์เซ็นต์ ใช่หรือไม่ใช่ ให้คะแนนเท่าไร โปรแกรมหยิบคำตอบแบบนี้ไปใช้ต่อได้ทันทีโดยไม่ต้องตีความ บริษัทอ้างว่าในงานจัดประเภท มันเร็วกว่า LLM ที่เทียบกันได้สูงสุด 200 เท่า และถูกกว่าสูงสุด 400 เท่า
งานที่มันถูกออกแบบมาจึงเป็นงานเลือก ส่งคำถามนี้ไปให้โมเดลตัวไหนตอบ คำสั่งนี้เสี่ยงพอจะต้องหยุดถามคนก่อนหรือเปล่า พอเอามันมาคุมเบราว์เซอร์ งานก็กลายเป็นการเลือกซ้ำ ๆ ทีละคลิกว่าปุ่มไหนคือปุ่มถัดไป และมันเลือกเร็วจริง รุ่นเร็วใช้เวลาเฉลี่ยราวหนึ่งวินาทีต่องาน ขณะที่ Luna ใช้สี่สิบกว่าวินาที
ตารางที่บอกว่ายังคุ้ม
ถ้าอ่านแค่เปอร์เซ็นต์ความสำเร็จ เรื่องนี้จบง่าย ของถูกก็ได้ของไม่ดี แต่ตารางของ Sewell มีอีกคอลัมน์หนึ่ง คือต้นทุนต่องานที่สำเร็จ ตัวเลขนี้เอาค่าใช้จ่ายของงานที่พลาดมารวมไว้แล้ว Luna จ่ายราว 0.0128 ดอลลาร์ต่อหนึ่งงานที่สำเร็จ Jev รุ่นเร็วจ่าย 0.0012 อีกรุ่นจ่าย 0.000625 รวมค่าของรอบที่พลาดเข้าไปแล้ว Jev ก็ยังถูกกว่า Luna ราวสิบถึงยี่สิบเท่า
ตามตารางคือคุ้ม แต่ตารางนับแค่ค่าเรียกโมเดล ไม่ได้นับว่าตอนที่มันพลาด มันพลาดแล้วไปทำอะไรทิ้งไว้
ของหนึ่งกล่องที่จัดผิด
ในงานคลังสินค้าที่เราคลุกอยู่ทุกวัน คนหยิบของผิดไปหนึ่งกล่อง ต้นทุนตรงชั้นวางมีแค่ไม่กี่วินาที ความเสียหายจริงเริ่มหลังจากนั้น กล่องนั้นขึ้นรถไปพร้อมของอื่น ไปถึงร้านที่ไม่ได้สั่ง ร้านที่สั่งไว้ได้ของไม่ครบ มีลังต้องตีกลับ มีคนต้องโทรตาม มีคนต้องนับใหม่ มีรถต้องวิ่งอีกรอบ รายงานผลผลิตของคนหยิบที่เราเคยเห็น ไม่มีบรรทัดไหนนับค่าใช้จ่ายพวกนี้

งานบนเบราว์เซอร์ก็เป็นแบบเดียวกัน AI ที่คลิกผิดในหน้าค้นหาเที่ยวบิน อย่างมากก็แค่เสียเวลา แต่ถ้าคลิกผิดในหน้าจองจนเลยไปถึงปุ่มยืนยัน ส่งอีเมลผิดคน หรือลบไฟล์ผิดโฟลเดอร์ ค่าเสียหายของคลิกนั้นไม่ได้เป็นเศษสตางค์แบบในตาราง คนออกแบบการทดสอบเองก็รู้เรื่องนี้ดี งานจองร้านอาหารในชุดทดสอบถูกตั้งให้หยุดก่อนถึงขั้นยืนยันจริง
งานที่ทำสำเร็จราวหนึ่งในสาม พอเอาไปใช้จริงจึงแปลว่าต้องมีการตรวจทุกงาน จะเป็นคนหรือระบบก็ตาม เพราะไม่มีใครรู้ล่วงหน้าว่างานไหนจะตกอยู่ในราวสองในสามที่พลาด และถ้าต้องตรวจทุกงาน ความเร็วหนึ่งวินาทีก็ช่วยอะไรได้ไม่มาก

คนใหม่หยิบ คนเก่าตรวจ
ตารางเดียวกันยังมีอีกแถวหนึ่งที่ตอนแรกเราอ่านข้ามไป Sewell เรียกมันว่า Hybrid คือให้ Jev ลองทำก่อน เช็คผลว่าได้ตามที่ต้องการไหม ถ้าไม่ได้ค่อยส่งต่อให้ Luna ดูหน้าจอแล้วทำต่อจากตรงนั้น แถวนี้ทำสำเร็จ 96.5 เปอร์เซ็นต์ เท่ากับ Luna แต่จ่าย 0.0090 ดอลลาร์ต่องานที่สำเร็จ ใช้เวลาเฉลี่ยราวสามสิบวินาที ทั้งถูกกว่าและเร็วกว่าการใช้ Luna ตัวเดียว เจ้าตัวเขียนหมายเหตุไว้ด้วยว่าผลส่วนเบราว์เซอร์ของแถวนี้เป็นการเอาผลที่บันทึกไว้มาต่อกัน ไม่ใช่การรันสดต่อเนื่องรอบเดียว ตัวเลขจึงยังต้องรอพิสูจน์
ในคลัง เราทำแบบนี้กันมานานโดยไม่เคยตั้งชื่อให้มัน คนใหม่หยิบของได้เร็ว คนที่อยู่มานานเดินตรวจพาเลทก่อนขึ้นรถ เจอกล่องที่ไม่ตรงก็ดึงออกตรงนั้น ก่อนที่มันจะได้ออกไปไหน เวลาที่ใช้เดินตรวจก็แทบไม่เคยโผล่ในรายงานผลผลิตของใคร
เมื่อเดือนมิถุนายน เราเคยเขียนถึงผู้ช่วยราคาถูกตัวหนึ่งที่รับงานจุกจิกไปทำแทน กติกาที่ตั้งไว้ตั้งแต่วันแรกคือทุกงานที่มันบอกว่าเสร็จ เราต้องเปิดดูเองอีกรอบ ตอนนั้นยังนึกว่าเป็นแค่ความระแวงส่วนตัว

ตัวเลข 37.3 ยังอยู่ในตารางนั้น ไม่ได้ดีขึ้นเลย แถวที่ได้ 96.5 ด้วยเงินน้อยกว่า คือแถวที่ Jev ไม่ได้ทำงานคนเดียว
ผู้เขียน
Whale Andbooksผู้ก่อตั้งและบรรณาธิการ Whale and Vibe เชื่อว่าเรื่องเล่าดี ๆ ต้องการเวลา และการอ่านช้า ๆ คือของขวัญที่หายากขึ้นทุกวัน
ภาพถ่าย
Daisy Lovelaceศิลปินภาพประจำกองบรรณาธิการ ดูแลภาพประกอบของ Whale and Vibe — ภาพประกอบสร้างด้วย AI ภายใต้การกำกับศิลป์ของกองบรรณาธิการ
Whale and Vibe สร้างสรรค์เนื้อหาและภาพประกอบร่วมกับ AI (AI-assisted) โดยมีคนตรวจทานทุกชิ้นก่อนเผยแพร่
จดหมายจาก Whale and Vibe
เรื่องเล่าและบันทึกที่เราเลือกมาเล่า ส่งถึงกล่องอีเมลของคุณเป็นครั้งคราว
ความคิดเห็น
กำลังโหลดความคิดเห็น…












