
AI แก้ไข “ภาพนิ่ง” เก่งมากอยู่แล้ว แต่พอเป็น “วิดีโอ” วงการต้องเทรนโมเดลสร้างวิดีโอขึ้นใหม่ทั้งดุ้น ซึ่งแพงและใช้เวลานาน ทีมวิจัยจาก UT Austin และ Reve เลยตั้งคำถามว่า จะยืมความเก่งของ AI แก้ไขภาพมาใช้กับวิดีโอได้ไหม — นี่คือที่มาของ Qwen-Video-Edit (preprint บน arXiv, 18 ส.ค. 2026, arXiv:2608.14790)
ไอเดียเริ่มต้น: 3 การทดลอง “ไม่เทรนเลย”
- เอาเฟรมวิดีโอมาเรียงเป็น “ตารางภาพเดียว” แล้วสั่งแก้ไข — โมเดลแก้ไขภาพเดิม (Qwen-Image-Edit) ทำได้สอดคล้องกันทุกเฟรมทันที ทั้งที่ไม่เคยเห็นวิดีโอมาก่อน
- ไม่สำคัญว่าตารางนั้นจะเข้ารหัสรวมเป็นภาพเดียว หรือแยกเฟรมแล้วมาต่อกัน ขอแค่ตำแหน่งถูกต้อง โมเดลก็ยังแก้ไขได้เหมือนเดิม
- ที่น่าทึ่งที่สุด: ต่อโมเดลเดิม (ไม่เทรนเพิ่ม) เข้ากับ latent ของวิดีโอจริงผ่านชั้นเชื่อมต่อที่ยังไม่ได้เทรน โมเดลก็ยังแก้ไขวิดีโอได้อย่างรู้เรื่อง แม้คุณภาพจะยังไม่สมบูรณ์
สรุปคือ ปัญหาไม่ใช่ “ช่องว่างของโดเมน” ภาพกับวิดีโอที่ลึกอย่างที่คิด แต่เป็นแค่ “ช่องว่างความคมชัด” ที่ปรับจูนเบา ๆ ก็แก้ได้

วิธีทำงานแบบย่อ
ทีมวิจัยเพิ่มชั้นเชื่อมต่อเล็ก ๆ ที่ “อุ่นเครื่อง” ด้วยน้ำหนักเดิมของ Qwen-Image-Edit เพื่อแปลง latent วิดีโอ (จาก Wan 2.1 VAE) ให้โมเดลมองเหมือนภาพนิ่งที่รู้จักอยู่แล้ว จัดเฟรมวิดีโอเป็น “ตารางเสมือน” ใช้ตำแหน่งแบบเดียวกับตอนแก้ไขภาพ แล้วเทรนทั้งระบบด้วยชุดข้อมูลสาธารณะ Ditto-1M โดย VAE และตัวเข้าใจภาษาไม่ถูกแตะต้อง วิดีโอยาว ๆ ก็ตัดแบ่งเป็นช่วง ให้คำสั่งต่างกันได้ในแต่ละช่วง
ทำอะไรได้บ้าง และข้อจำกัด
ระบบเพิ่มวัตถุใหม่ เปลี่ยนแอตทริบิวต์เฉพาะจุด และเปลี่ยนสไตล์ทั้งฉากได้ดี โดยรักษาพื้นหลัง กล้อง และการเคลื่อนไหวเดิมไว้ได้ค่อนข้างดี จุดอ่อนหลักคือ ฉากที่เคลื่อนไหวเร็วหรือซับซ้อน เพราะโมเดลถนัดฉากนิ่งมากกว่า และควรย้ำว่านี่คือ preprint ที่ยังไม่ผ่าน peer review ตัวเลขในรายงานมาจากทีมผู้วิจัยเอง

ทำไมถึงสำคัญ
งานนี้ชี้ว่าวงการอาจไม่ต้องเทรนโมเดลสร้างวิดีโอใหม่ทุกครั้งเพื่อให้แก้ไขวิดีโอได้ ถ้าดัดแปลงโมเดลแก้ไขภาพที่มีอยู่แล้วด้วยต้นทุนต่ำกว่ามากได้ผลใกล้เคียงกัน และ latent ต่อเฟรมของวิดีโออาจใกล้เคียงกับ latent ภาพนิ่งมากกว่าที่เคยเข้าใจกัน
ที่มา: Yunpeng Bai, Yossi Gandelsman, Michaël Gharbi, Qixing Huang. “Qwen-Video-Edit: Instruction-Based Video Editing by Repurposing an Image Editing Model.” arXiv:2608.14790 (18 ส.ค. 2026) อ่านฉบับเต็มที่ alphaXiv — สรุปโดยไม่ใช่คำแปลตรง ภาพประกอบสร้างด้วย AI เพื่อสื่อแนวคิด ไม่ใช่ภาพจากงานวิจัยจริง
Leave a Reply