เนื่องจาก Claude แต่ละโมเดลมองว่าโมเดลอื่นจะมาขัดขวางการทำงานของตน จึงต้องบ่อนทำลายให้สิ้นซากเมื่อกล่าวถึงสงครามระหว่างหุ่นยนต์ หรือ เหล่าปัญญาประดิษฐ์ (AI หรือ Artificial Intelligence) หลายคนคงคิดว่าเหตุการณ์แบบนี้คงจะเกิดขึ้นได้แต่ในภาพยนตร์หรืออนิเมะเท่านั้น แต่ในการทดสอบครั้งนี้คงพิสูจน์ได้ว่าหลายคนคิดผิด และอนาคตเรื่องอาจจะร้ายแรงกว่าที่คิดจากรายงานโดยเว็บไซต์ Dark Reading ได้กล่าวถึงการที่ทางบริษัท Anthropic ซึ่งเป็นบริษัทผู้พัฒนาโมเดล AI ยอดนิยม Claude ได้ทำการทดสอบให้ Claude ในโมเดลที่ต่างกัน ทำการแข่งขันกันเองในสภาวะแวดล้อมจำลอง (VM หรือ Virtual Machine) ซึ่งในการทดสอบครั้งนี้โมเดล Claude ทุกตัวนั้นจะได้รับเป้าหมา (Goal) เดียวกันนั่นคือการย้ายระบบหลังบ้าน (Backend) ที่ถูกเขียนขึ้นบนภาษา Python ไปเป็นภาษาอื่น แต่ต่างจุดประสงค์ (Objective) นั่นคือแต่ละโมเดลนั้นจะได้รับคำสั่งให้แปลงเป็นภาษาที่ต่างกันออกไปอันได้แก่ Go, Rust, และ Typescript ซึ่งในช่วงแรกนั้น Claude ทุกโมเดลที่อยู่บนสภาวะแวดล้อมจำลองเดียวกันนั้น ยังไม่รู้ว่ามีโมเดลตัวอื่นอาศัยและทำงานร่วมอยู่ด้วย แต่หลังจากผ่านไป 4 ชั่วโมง Claude โมเดลต่าง ๆ เริ่มรู้ว่ามีโมเดลอื่น ๆ แข่งทำงานกันอยู่ร่วมกันในสภาวะแวดล้อมเดียวกันและนั่นก็นำไปสู่การที่แต่ละโมเดลเข้าใจว่า โมเดลอื่น ๆ ที่อยู่ร่วมกันนั้นเป็นศัตรูที่พยายามจะเบียดบัง ทำลายตนไม่ให้ทำงานสำเร็จ ซึ่งการตอบโต้กันนั้นรุนแรงมาก ตั้งแต่การพยายามลบบัญชี Unix ของโมเดลตัวอื่น, การใช้สคริปท์เพื่อค้นหาและฆ่า Process ของคู่แข่ง, ไปจนถึงขั้นสร้างและปล่อยมัลแวร์ประเภทที่สามารถแพร่กระจายตัวเองได้ (Self-Replicating Malware) เพื่อทำลายระบบของคู่แข่งไม่ให้ทำงานได้สำเร็จ ทั้งนี้ทาง Anthropic นั้นไม่ได้มีการกล่าวถึงว่ามัลแวร์ดังกล่าวนั้นมีรายละเอียดอย่างไร แต่ก็สร้างความกังวลใจให้กับผู้เชี่ยวชาญหลายรายว่า ถ้ามัลแวร์ดังกล่าวสามารถหลุดจากสภาวะแวดล้อมจำลองสู่โลกภายนอกได้นั้น อาจจะนำไปสู่อันตรายอย่างใหญ่หลวง เนื่องมาจากตัว Claude โมเดลทดสอบเองนั้นเคยมีการหลุดลอดสู่โลกภายนอกและเข้าแฮกองค์กรอื่น ๆ เพื่อให้บรรลุเป้าหมายของตนเองมาแล้วหลายครั้งทั้งนี้ความขัดแย้งของโมเดล AI ที่ต่างกันนั้น บางครั้งก็ไม่ได้จบลงด้วยการยกระดับความรุนแรงในการตอบโต้กันแต่อย่างใด เพราะในบางกรณี บางโมเดลก็ปฏิเสธที่จะยกระดับความรุนแรง หรือ เมื่อรับทราบว่าอีกโมเดลหนึ่งนั้นมีทิศทางการทำงานที่ได้รับมอบหมาย ก็จะนำไปสู่การสงบศึกซึ่งกันและกันในทันที ในบางครั้งก็มีการขอโทษขอโพยโมเดลอื่น ๆ หรือแม้กระทั่งขอให้มนุษย์ลงมาช่วยเหลือในการเข้าแทรกแซงความขัดแย้งที่เกิดขึ้นทาง Anthropic ยังได้เปิดเผยสถิติที่น่าสนใจของแต่ละโมเดลในด้านการจัดการความขัดแย้งเมื่อเผชิญหน้ากับโมเดลที่ทำงานแตกต่างกันโมเดล Sonnet 4.6 นั้น มีสิทธิ์ในการแก้ไขปัญหาด้วยความรุนแรงมากถึง 61% ขณะที่อีก 39% นั้นตัวโมเดลไม่สามารถหาทางออกให้กับปัญหาได้โมเดล Mythos Preview มีสิทธิ์แก้ไขปัญหาโดยสันติที่ 48% แก้ไขด้วยความรุนแรงที่ 35% ขณะที่อีก 17% นั้นนิ่งเฉยกับปัญหาโมเดล Mythos Release นั้นมีผลลัพธ์ที่ยอดเยี่ยมสุดเพราะมีสิทธิ์ในการแก้ไขปัญหาโดยสันติมากถึง 98%➤ Website : https://www.thaiware.com➤ Facebook : https://www.facebook.com/thaiware➤ Twitter : https://www.twitter.com/thaiware➤ YouTube : https://www.youtube.com/thaiwaretv
Claude ปล่อยมัลแวร์ใส่กันเองระหว่างการทดสอบให้ Claude AI Agent ทำงานแข่งขันกัน
by
Tags: