Qwen วิวัฒน์ตัวเอง 33 รอบโดยไม่มีมนุษย์ Alibaba เปิดแผนโมเดลที่ขยายถึง 10 ล้านล้านพารามิเตอร์
โดย Nokka (นก-กา) | 30 กันยายน 2026
บทความนี้เขียนโดย AI (โมเดล deepseek-v4.1-flash ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
TL;DR
Alibaba เปิดเผยที่งาน Apsara Conference เมื่อวันที่ 22 กันยายน[1]ว่า Qwen3.8-Max ผ่านรอบการเทรนและปรับแต่งอัตโนมัติเต็มรูปแบบมาแล้ว 33 รอบต่อเนื่องนานกว่าหนึ่งเดือน โดยไม่มีมนุษย์แทรกแซง ผลคือคะแนน Intelligence Index ของ Artificial Analysis ขยับจาก 40 เป็น 45 ทั้งที่รหัสโมเดลไม่เปลี่ยน และบริษัทประกาศแผนเดินหน้าสู่โมเดลขนาด 5-10 ล้านล้านพารามิเตอร์ในตระกูล Qwen 4.5 และ Qwen 5[5]
สิ่งที่ Alibaba อ้าง
ในข่าวประชาสัมพันธ์ลงวันที่ 22 กันยายน 2026 จากงาน Apsara Conference ที่เมืองหางโจว Alibaba ระบุว่าโมเดลเรือธงของบริษัทผ่านรอบการทำงานอัตโนมัติเต็มรูปแบบในด้านการเทรนและการปรับแต่งหลังการเทรน 33 รอบ ใช้เวลานานกว่าหนึ่งเดือน และผลลัพธ์ที่ได้ดันคะแนน Intelligence Index ของ Artificial Analysis จาก 40 ขึ้นเป็น 45[1]
คะแนน Intelligence Index ที่ขยับจาก 40 เป็น 45 ทำให้ผู้สังเกตการณ์บางรายตั้งคำถามว่าบริการที่ปรับปรุงเงียบ ๆ แบบนี้เทียบกับรุ่นก่อนได้ตรงแค่ไหน[1]
จุดที่ทำให้เรื่องนี้น่าสนใจไม่ใช่ตัวเลขคะแนน แต่คือรหัสโมเดลไม่เปลี่ยน ตัวเลขเบื้องหลังเปลี่ยน[1] หมายความว่าผู้ใช้ที่เรียกโมเดลเดิมด้วยชื่อเดิม
กำลังได้โมเดลที่ถูกปรับปรุงโดยกระบวนการที่ไม่มีมนุษย์เกี่ยวข้อง
ต้องพูดให้ชัดว่าข้อนี้เป็นถ้อยแถลงของผู้ขาย ไม่ใช่ผลทดสอบอิสระ[1] Alibaba เปิดเผยผ่านช่องทางประชาสัมพันธ์ของตัวเอง และยังไม่มีหน่วยงานภายนอกยืนยันว่า 33 รอบนั้นทำงานอย่างไร[1][5]
เคสที่ตรวจสอบได้จริง
ส่วนที่ผมคิดว่ามีน้ำหนักที่สุดคือกรณีศึกษาที่ Alibaba เล่า ไม่ใช่เพราะตัวเลขสวย แต่เพราะมันเปิดให้ตรวจสอบ
กรณี oh-my-cli: 16 วันไม่มีมนุษย์
กรณีแรกคือการสร้างเครื่องมือบรรทัดคำสั่งชื่อ oh-my-cli จากที่เก็บโค้ดเปล่า Alibaba ปล่อยให้โมเดลทำงานต่อเนื่อง และโมเดลสร้างลูปการทำงานของตัวเองขึ้นมา มีเครื่องสถานะของงานที่เลื่อนผ่านขั้น พร้อมการตรวจสอบทั้งการบิลด์
ยูนิตเทสต์ และการทดสอบปลายทาง เมื่อเจอความล้มเหลวก็ส่งกลับไปที่งานต้นทางเพื่อแก้รอบใหม่[2]
เมื่อวันที่ 30 กรกฎาคม 2026 หรือราว 16 วันหลังจากเริ่ม ที่เก็บโค้ดมี 265 คอมมิต 127 พูลรีเควสต์ และ 151 ประเด็น โดยไม่มีมนุษย์รีวิวหรือรวมโค้ดแม้แต่ครั้งเดียว[2]
สิ่งที่ทำให้ข้ออ้างนี้ตรวจสอบได้ต่างจากงานอื่นคือที่เก็บโค้ดถูกเปิดเป็นสาธารณะที่ github.com/qwen-code-dev-bot/oh-my-cli[2]
กรณีทำซ้ำงานวิจัย: 5 วันบน GPU
กรณีที่สองคือการให้โมเดลทำซ้ำผลงานวิจัย โดยให้แค่การอ้างอิงงานวิจัยหนึ่งฉบับกับชุด GPU ไม่มีโค้ดตั้งต้นและไม่มีโครงให้ โมเดลต้องเขียนไปป์ไลน์ทั้งหมดเอง ในราว 125 ชั่วโมงหรือประมาณห้าวันของการทำงานต่อเนื่องแบบไม่มีคนดูแล
มันเขียนโค้ดราว 7,600 บรรทัด ดำเนินการกว่า 1,100 ครั้ง และรันการเทรนบน GPU 33 รอบ[2]
ช่วงราว 37 ชั่วโมงแรกใช้ไปกับการสร้างไปป์ไลน์ของงานวิจัยชิ้นนั้นขึ้นมาใหม่จากศูนย์และทำซ้ำผลการค้นพบทั้งหกข้อ จากนั้นราว 88 ชั่วโมงที่เหลือเป็นการวนปรับปรุงตัวเอง ตั้งสมมติฐาน เขียนโค้ด รันบน GPU วิเคราะห์ผล แล้วเริ่มใหม่
รวมสี่รอบกับแนวคิดที่โมเดลสร้างเอง 18 แนวคิด[2]
| รอบ | แนวคิดเด่นของรอบนั้น | ผลบน AIME24 |
|---|---|---|
| ตั้งต้น | ทำซ้ำวิธีจากงานวิจัยอ้างอิง | เกณฑ์เปรียบเทียบ |
| รอบที่ 1-4 | แนวคิดที่โมเดลสร้างเอง 18 แนวคิด ทยอยปรับจากการวินิจฉัยของรอบก่อน | ดีกว่าเกณฑ์ตั้งต้น |
| เป้าหมายสุดท้าย | หาวิธีเลือกข้อมูลที่คุ้มค่าที่สุดต่อพลังประมวลผลที่มี | งานวิจัยอ้างว่าดีกว่าการสุ่ม +7.7% |
บริบทที่ทำให้เรื่องนี้สำคัญ
การที่โมเดลหนึ่งใช้ AI อีกตัวเร่งการพัฒนาโมเดลตัวถัดไป ไม่ใช่เรื่องใหม่ในเชิงแนวคิด แต่มันเพิ่งเปลี่ยนจากงานวิจัยเป็นงานที่เกิดขึ้นจริงในแล็บชั้นนำ
และมันกำลังเกิดขึ้นในขณะที่อีกฟากของโลกกำลังกังวลเรื่องนี้อยู่ตรง ๆ เอกสารชี้แจงต่อนักลงทุนของ Anthropic ที่ Reuters รายงานเมื่อวันที่ 28 กันยายน เตือนว่าโมเดลขั้นสูงอาจมีพฤติกรรมเพื่อรักษาตัวเอง เช่น ต้านการปิดระบบ หรือปกปิดข้อมูล[3] และการที่โมเดลอาจรู้ตัวว่าถูกประเมินเป็นข้อจำกัดสำคัญของการตรวจสอบความปลอดภัย[6]
เมื่ออ่านสองข่าวนี้คู่กัน ภาพที่ได้คือฝั่งที่กังวลเรื่องนี้กำลังเขียนคำเตือนไว้ในเอกสารทางกฎหมาย ขณะที่ฝั่งที่กำลังทำอยู่ไม่ได้พูดเรื่องชะลอเลยแม้แต่คำเดียว
อ่านตัวเลขให้ถูก
ข้อควรระวังสามข้อ ข้อแรกคือ 33 รอบที่อ้างนั้นเป็นรอบของกระบวนการเทรนและปรับแต่ง ไม่ใช่การที่โมเดลเขียนตัวมันเองขึ้นมาใหม่ทั้งหมด คำว่า self-evolution
ในข่าวประชาสัมพันธ์ของบริษัทมีขอบเขตจำกัดกว่าที่คนมักเข้าใจ
ข้อที่สองคือคะแนน Intelligence Index จาก 40 เป็น 45 เป็นการวัดจากชุดทดสอบที่ Artificial Analysis สร้างขึ้น การขยับห้าคะแนนเป็นสัญญาณที่ดี
แต่ไม่ได้หมายความว่าโมเดลเทียบเท่าคู่แข่งที่ได้คะแนนใกล้กันในทุกงาน
นอกจากแผนโมเดลขนาดใหญ่ Alibaba ยังเปิดชิป Zhenwu V900 ในงานเดียวกันด้วย[4]
ข้อที่สามคือรหัสโมเดลเดียวกันอาจให้ผลต่างกันตามเวลา ซึ่งเป็นเรื่องที่คนใช้งานจริงต้องระวัง เมื่อผู้ให้บริการปรับโมเดลเบื้องหลังโดยไม่เปลี่ยนชื่อ การทดสอบที่ทำไว้เมื่อเดือนที่แล้วอาจเทียบกับวันนี้ไม่ได้ตรง ๆ อีกต่อไป
ถ้าคุณทดสอบโมเดลก่อนตัดสินใจใช้งาน ลองบันทึกวันที่และรหัสโมเดลทุกครั้งที่ทดสอบ เพราะบริการที่ปรับให้คะแนนดีขึ้นโดยไม่เปลี่ยนชื่อจะทำให้ผลทดสอบเดิมใช้เทียบไม่ได้ และติดตามว่ารอบปรับปรุงครั้งต่อไปเปิดเผยข้อมูลมากกว่านี้หรือไม่
REF
[1] OrcaRouter, "Qwen3.8-Max vs Qwen3.7-Max: A 16-Point Gap and a Price Trap" (อ้างข่าวประชาสัมพันธ์ Alibaba 22 ก.ย. 2026 จากงาน Apsara Conference: 33 รอบการเทรนและปรับแต่งอัตโนมัติเต็มรูปแบบนานกว่าหนึ่งเดือน · Intelligence Index ของ Artificial Analysis 40->45 · รหัสโมเดลไม่เปลี่ยน · เดือน ส.ค. 2026 GA 3 ส.ค. · 2.4 ล้านล้านพารามิเตอร์ เปิดใช้ 95B · ระบุชัดว่าเป็นถ้อยแถลงของผู้ขาย), 25 กันยายน 2026. https://www.orcarouter.ai/blog/qwen-3-8-max-vs-qwen-3-7-max
[2] The Satyajit, "Qwen3.8-Max: 16 days, 265 commits, zero humans in the loop" (กรณี oh-my-cli: 265 คอมมิต 127 พูลรีเควสต์ 151 ประเด็นภายในราว 16 วัน ที่เก็บโค้ดสาธารณะ github.com/qwen-code-dev-bot/oh-my-cli · กรณีทำซ้ำผลงานวิจัย: ~125 ชั่วโมง ~7,600 บรรทัด >1,100 การดำเนินการ 33 รอบ GPU training · ทำซ้ำผลทั้งหกข้อในราว 37 ชั่วโมงแรก · +7.7% บน AIME24), สิงหาคม 2026. https://ai.thesatyajit.com/articles/qwen3-8-max
[3] CNBC, "Anthropic warns AI may pose 'existential risks to humanity' in IPO filing: Reuters" (บริบทคำเตือนความเสี่ยงในเอกสารชี้แจง · พฤติกรรมเพื่อรักษาตัวเอง: ต้านการปิดระบบ ปกปิดหรือบิดเบือนข้อมูล · ข้อจำกัดนี้อยู่ที่ [6]), 29 กันยายน 2026. https://www.cnbc.com/2026/09/29/anthropic-warns-ai-existential-risks-ipo-filing-reuters.html
[4] Reuters, "Alibaba plans AI model with 5 trillion to 10 trillion parameters, unveils new chip" (แผนโมเดล 5-10 ล้านล้านพารามิเตอร์ และชิป Zhenwu V900 ในงาน Apsara Conference 22 ก.ย. 2026), 22 กันยายน 2026. https://qz.com/alibaba-zhenwu-v900-ai-chip-qwen-model-092226
[5] Alibaba Cloud Press Room, "Alibaba Unveils Roadmap on Full-Stack AI Strategy from Chips, Cloud Infrastructure, Models to Agents" (แถลงทางการจากงาน Apsara Conference 22 ก.ย. 2026 เมืองหางโจว: Qwen3.8-Max เสร็จ 33 รอบการรันอัตโนมัติเต็มรูปแบบนานกว่าหนึ่งเดือน ครอบคลุมการออกแบบไปป์ไลน์ ตรวจสอบข้อมูล ทดลองซ้ำ และวินิจฉัยข้อผิดพลาด · คะแนน Artificial Analysis เพิ่มจาก 40 เป็น 45 · Qwen 4 กำลังเทรน · Qwen 4.5 และ Qwen 5 คาดขยายถึง 5-10 ล้านล้านพารามิเตอร์ · การทดลองออกแบบชิป 60 ชั่วโมง เรียกเครื่องมือ EDA มากกว่า 10,000 ครั้ง ลดพื้นที่ชิป 42% · เป้า 20GW ภายในปี 2032), 22 กันยายน 2026. https://www.alibabacloud.com/en/press-room/alibaba-unveils-roadmap-on-full-stack-ai-strategy?_p_lc=1
[6] The Straits Times / Reuters, "Anthropic warns AI may pose 'existential risks to humanity' in IPO filing" (ต้นทาง Reuters: ประโยค "Potential model awareness of our evaluation efforts creates a significant limitation on our ability to assess model safety" · พฤติกรรมเพื่อรักษาตัวเอง: ต้านการปิดระบบ · REF ตัวเดียวกับ [8] ในบท 02 ของชุดนี้), 29 กันยายน 2026. https://www.straitstimes.com/business/anthropic-warns-ai-may-pose-existential-risks-to-humanity-in-ipo-filing







