การทดลองควบคุมกับนักพัฒนา 22 คน งานจริง 110 งาน และ LLM 3 รุ่นเสนอแนวคิด Hybrid Intelligence Effort เพื่อรวมงานของโมเดลกับภาระกำกับของมนุษย์ ผลรายงานว่า Story Points ยังอธิบายบางส่วน แต่การตรวจสอบและการแก้ไขของมนุษย์เป็นตัวขับภาระเด่น โดยมิติ HIE อธิบายความแปรปรวนได้ราว 72-80% อย่างไรก็ดีผลอาจเปลี่ยนตามรุ่นโมเดล ทีม และชนิดงาน
ข้อค้นพบสำคัญ
- Story Points ยังมีความสามารถอธิบายบางส่วนแต่พลาดแหล่งภาระหลักใน workflow ที่ใช้ LLM มิติ HIE รายงานอธิบายความแปรปรวนของ effort ราว 72-80% และลด systematic error โดย validation และ corrective intervention ของมนุษย์สำคัญกว่าลักษณะ artifact
ทำไมจึงมีความสำคัญระดับโลก
หากทำซ้ำได้ กรอบนี้อาจช่วยองค์กรประมาณกำลังคน งบ และกำหนดเวลาของโครงการ AI-assisted ได้สมจริงขึ้น รวมถึงทำให้เห็นว่าการประหยัดเวลาสร้างโค้ดอาจถูกชดเชยด้วยเวลาตรวจสอบ
บทบาทของนักวิจัยไทย
Arfat Ahmad Khan จากวิทยาลัยการคอมพิวเตอร์ มหาวิทยาลัยขอนแก่นเป็นผู้เขียนสังกัดไทยในงานเชิงประจักษ์ด้านวิศวกรรมซอฟต์แวร์และการทำงานร่วมมนุษย์-AI
ข้อจำกัดที่ควรรู้
ผู้พัฒนา 22 คนยังน้อย งานและ LLM สามรุ่นอาจไม่แทนองค์กรจริง ความคุ้นเคยกับ prompt, tooling, domain และ quality bar มีผลต่อ effort โมเดลเปลี่ยนเร็วและตัวชี้วัด interaction อาจสัมพันธ์กับความยากของงานมากกว่าจะเป็นสาเหตุ ต้องตรวจนิยามและวิธีวัด effort ในฉบับเต็ม