ค้นพบว่า LLM คืออะไร ถูกฝึกอย่างไร และทำไมมันจึงดูเหมือนรู้ทุกอย่าง
เปิดบทเรียนนี้ใน Kodokonคุณคงเคยได้ยินชื่อ ChatGPT, Claude หรือ Gemini มาแล้ว สิ่งเหล่านี้คือ AI เชิงสร้างสรรค์: โปรแกรมคอมพิวเตอร์ที่สามารถสร้างข้อความใหม่ทั้งหมด (คำอธิบาย บทสรุป บทกวี หรือโค้ด) จากคำขอที่เขียนเป็นตัวอักษร เครื่องยนต์ที่ซ่อนอยู่เบื้องหลังมันเรียกว่า LLM ซึ่งย่อมาจาก *Large Language Model* ในทางคอมพิวเตอร์ "โมเดล" คือโปรแกรมที่ได้เรียนรู้รูปแบบต่าง ๆ จากตัวอย่าง แทนที่จะใช้กฎที่มนุษย์เขียนขึ้นทีละข้อ
หลักการพื้นฐานนั้นเรียบง่ายอย่างน่าประหลาดใจ: LLM คือ เครื่องที่ทำนายว่าข้อความจะดำเนินต่อไปอย่างไร เมื่อคุณอ่านว่า "แมวกำลังนอนหลับอยู่บน…" สมองของคุณจะเติมคำว่า "โซฟา" หรือ "เตียง" ขึ้นมาเองโดยธรรมชาติ LLM ก็ทำแบบเดียวกันเป๊ะ แต่ในระดับมหาศาล: ในทุก ๆ ขั้นตอน มันจะคำนวณว่าคำใด (หรือชิ้นส่วนของคำใด) มีความน่าจะเป็นมากที่สุดที่จะตามมา จากนั้นเพิ่มคำนั้นเข้าไป แล้วเริ่มใหม่อีกครั้ง ดังนั้นคำตอบทั้งหมดจึงเป็นเพียงชุดยาว ๆ ของการทำนายทีละคำ ๆ เท่านั้น มันคือกลไกเดียวกับคำแนะนำการพิมพ์บนแป้นพิมพ์โทรศัพท์ของคุณ เพียงแต่ทรงพลังกว่ากันอย่างเทียบไม่ติด
คุณคือครูที่ใจเย็นซึ่งอธิบายเรื่องคอมพิวเตอร์ให้ผู้เริ่มต้นที่ไม่มีพื้นฐานเลยฟัง
อธิบายให้ฉันฟังว่าโมเดลภาษาขนาดใหญ่ (LLM) คืออะไร ราวกับว่าฉันอายุ 12 ปี โดยไม่มีศัพท์เทคนิคที่ไม่ได้นิยามไว้
ข้อกำหนด:
- ใช้การเปรียบเทียบจากชีวิตประจำวัน
- ไม่เกิน 10 ประโยค
- จบด้วยคำถามเพื่อตรวจสอบว่าฉันเข้าใจแล้วเครื่องนี้เรียนรู้ที่จะทำนายได้ดีขนาดนี้ได้อย่างไร? ผ่าน การฝึก (training): ช่วงหนึ่ง (ก่อนบทสนทนาครั้งแรกของคุณ) ที่โมเดล "อ่าน" ข้อความในปริมาณมหาศาล - หนังสือ บทความ เว็บไซต์ โค้ดคอมพิวเตอร์ สำหรับแต่ละประโยค ส่วนที่ตามมาจะถูกซ่อนไว้ และโมเดลจะถูกขอให้เดามัน เมื่อมันเดาผิด พารามิเตอร์ (parameters) ของมันจะถูกปรับเล็กน้อย - นั่นคือค่าตั้งค่าภายในเล็ก ๆ นับพันล้านของมัน ทำซ้ำแบบนี้นับพันล้านครั้ง แล้วโมเดลก็จะจับหลักไวยากรณ์ สไตล์ และองค์ความรู้จำนวนมหาศาลที่พบในข้อความฝึกของมันได้ในที่สุด
นี่คือเหตุผลที่ AI เชิงสร้างสรรค์ ดูเหมือนรู้ทุกอย่าง: มันได้ "อ่าน" ห้องสมุดที่ใหญ่กว่าที่มนุษย์คนหนึ่งจะอ่านได้แม้ในหนึ่งพันชาติ แต่ระวังคำนี้ไว้ให้ดี: *ดูเหมือน* โมเดลไม่ได้เปิดสารานุกรมดูตอนที่มันตอบ และมันไม่ได้ "เข้าใจ" แบบที่คุณเข้าใจ มันคำนวณลำดับคำที่ น่าจะเป็นไปได้ มากที่สุดจากการฝึกของมัน ส่วนใหญ่แล้ว น่าจะเป็นไปได้ = จริง แต่ไม่เสมอไป และนั่นคือหัวข้อของบทเรียนถัดไปพอดี
ฉันเพิ่งได้เรียนรู้ว่า LLM ทำงานด้วยการทำนายข้อความ ว่ามันถูกฝึกบนคลังข้อมูลขนาดมหึมา และว่ามันสร้างเพียงส่วนที่ตามมาซึ่งน่าจะเป็นไปได้มากที่สุดเท่านั้น
ช่วยถามฉัน 3 คำถาม ทีละคำถาม เพื่อตรวจสอบว่าฉันเข้าใจแนวคิดทั้งสามนี้จริง ๆ
รอคำตอบของฉันหลังแต่ละคำถาม แล้วช่วยแก้ไขให้ฉันอย่างใจดีก่อนถามคำถามถัดไป
อย่าเฉลยคำตอบให้ฉันก่อนที่ฉันจะได้ลองก่อน