DNAfinity — Competitive Consensus (2026-09-06 · median-of-4)
4 โมเดลให้คะแนนอิสระจาก code-truth · 16 แอป × 2 เครื่อง · self-assessment เชิง directional — ยังไม่ผ่าน user research ใช้จัดลำดับ product ไม่ใช่เคลมการตลาด
เทียบ 4 โมเดล + median + ช่วง
| App | 🟣 Opus 4.8 | 🟪 Opus 5 | 🟠 Codex | 🔵 Gemini | median | ช่วง | spread |
|---|---|---|---|---|---|---|---|
| AppForge | 4.00 | 4.14 | 4.14 | 4.00 | 4.07 | 4.00–4.14 | 0.14 ✅ |
| MU-AI Core | 4.00 | 4.00 | 4.00 | 4.00 | 4.00 | 4.00–4.00 | 0.00 ✅ |
| WorkDNA | 4.00 | 3.86 | 4.00 | 4.00 | 4.00 | 3.86–4.00 | 0.14 ✅ |
| SmeDNA | 3.86 | 3.86 | 4.14 | 3.86 | 3.86 | 3.86–4.14 | 0.28 ✅ |
| BloomDNA | 3.71 | 3.57 | 3.86 | 3.71 | 3.71 | 3.57–3.86 | 0.29 ✅ |
| InfluDNA | 3.57 | 3.57 | 3.71 | 3.57 | 3.57 | 3.57–3.71 | 0.14 ✅ |
| CareDNA | 3.57 | 3.43 | 3.71 | 3.43 | 3.50 | 3.43–3.71 | 0.29 ✅ |
| MU-AI Game | 3.43 | 3.43 | 3.57 | 3.43 | 3.43 | 3.43–3.57 | 0.14 ✅ |
| EmotiQ | 3.43 | 3.14 | 3.57 | 3.43 | 3.43 | 3.14–3.57 | 0.43 ⚠ |
| DataDNA | 3.29 | 3.43 | 3.43 | 3.29 | 3.36 | 3.29–3.43 | 0.14 ✅ |
| FinDNA | 3.14 | 3.29 | 3.14 | 3.14 | 3.14 | 3.14–3.29 | 0.15 ✅ |
| OperDNA | 3.00 | 3.00 | 3.00 | 3.00 | 3.00 | 3.00–3.00 | 0.00 ✅ |
| TradeDNA | 2.86 | 2.71 | 3.14 | 2.86 | 2.86 | 2.71–3.14 | 0.43 ⚠ |
| PetDNA | 2.86 | 2.71 | 2.86 | 2.86 | 2.86 | 2.71–2.86 | 0.14 ✅ |
| PlantDNA | 2.71 | 2.71 | 3.00 | 2.71 | 2.71 | 2.71–3.00 | 0.29 ✅ |
| MUAI-Verse | 2.57 | 2.43 | 2.71 | 2.57 | 2.57 | 2.43–2.71 | 0.28 ✅ |
| Portfolio | 3.38 | 3.33 | 3.47 | 3.36 | 3.37 | — | — |
รอบนี้เจออะไร
- ข้อพิพาทที่ค้างมาสองรอบปิดด้วยหลักฐาน ไม่ใช่การประนีประนอม — ทีมกลับไปเปิด scoreboard ของตัวเองแล้วพบว่าคำกล่าวที่ว่า “ยังไม่เคยวิ่งจริง” ผิด: 8 แอปมีบันทึกการยิงเข้าเครื่องยนต์จริงพร้อมรหัสตอบกลับ 201/202 → ข้อพิพาทยุบจาก 8 แอปเหลือ 1
- ไม่มีมิติไหนของแอปไหนที่ต่างกันเกิน 1 คะแนน — จาก 112 ช่อง ตรงกันสนิท 72 · ต่าง 1 คะแนน 40 · ต่าง ≥2 คะแนน 0 ช่อง
- MU-AI Core และ OperDNA มี spread 0.00 — ทั้ง 4 เสียงลงตัวเลขเดียวกันเป๊ะ
- diverge เกิน 0.30 เหลือ 2 แอป — EmotiQ และ TradeDNA อย่างละ 0.43 · ทั้งคู่อ่านหลักฐานชุดเดียวกันแล้วชั่งน้ำหนักต่างกัน ไม่ใช่เจอข้อเท็จจริงคนละชุด
- D7 = 1 ทั้ง 16 แอป ทุกโมเดล — internal proof (partner seed, demo fleet, แอปที่สร้างให้พาร์ตเนอร์) ไม่นับเป็น traction ภายนอก
ข้อพิพาทเรื่องการเชื่อมข้ามแอป — ปิดด้วยข้อเท็จจริง
ทั้งสี่โมเดลใช้เกณฑ์เดียวกันมาตั้งแต่ต้น — การเชื่อมที่ต่อครบแต่ยังไม่เคยวิ่งจริงได้ 3 ส่วนที่เคยวิ่งจริงแล้วได้ 4 · สิ่งที่ต่างกันคือ ข้อเท็จจริง ไม่ใช่เกณฑ์
ทีมกลับไปเปิดกระดานสถานะที่ตัวเองทำไว้ แล้วพบบันทึกการยิงข้อมูลเข้าเครื่องยนต์จริงของ 8 แอป พร้อมรหัสตอบกลับ 201 และ 202 — หลายแอปถึงขั้นขอให้ลบข้อมูลทดสอบของตัวเองออก ซึ่งแปลว่ามีแถวข้อมูลจริง · ข้อพิพาทที่เคยกระทบ 8 แอป จึงยุบเหลือ 1
ที่ยังได้ 3 มีสองแอปพร้อมเหตุผลที่ตรวจซ้ำได้: หนึ่งไม่มีแถวในกระดานเลย อีกหนึ่งเคยวิ่งจริงแต่โค้ดนั้นหลุดออกจากสายหลักไปแล้ว · บทเรียนของรอบนี้ไม่ใช่ตัวเลข แต่คือ ก่อนจะสรุปว่า “ไม่มีหลักฐาน” ต้องเปิดที่เก็บหลักฐานของตัวเองก่อน
อ่านคอลัมน์ Eco อย่างไรก่อนข้อพิพาทนี้ปิด
- D5 รอบนี้ ไม่ได้ใช้ไม้บรรทัดเดียวกันทั้งตาราง — เทียบ Eco ข้ามแอปได้เฉพาะภายในโมเดลเดียวกัน
- ค่าเฉลี่ย D5 ทั้งพอร์ตแยกตามโมเดล: Opus 4.8 3.62 · Gemini 3.56 · Codex 3.25 · Opus 5 3.62 — ช่วง 0.43 นี้เกือบทั้งหมดคือ นิยาม ไม่ใช่ของจริงที่ต่างกัน
ข้อจำกัดของรอบนี้
- Opus 4.8 กับ Opus 5 มาจากผู้ผลิตเดียวกัน — นับ 2 เสียงตามกติกา “1 โมเดล 1 เสียง” แต่ไม่ได้อิสระต่อกันเท่ากับ Codex/Gemini
- spread ที่แคบไม่ใช่หลักฐานว่าถูก — การเห็นตรงกันเร็วเป็นสัญญาณให้ตรวจ ไม่ใช่สัญญาณดี ข้อพิพาท Eco ข้างบนคือผลของการตรวจนั้น
- เทียบ portfolio average กับรอบก่อน 2026-07-16 ตรง ๆ ไม่ได้ — รอบก่อนหน้านั้นลิสต์แอปคนละชุด
self-assessment เชิง directional — ยังไม่ผ่าน user research ใช้จัดลำดับ product ภายใน ไม่ใช่เคลมการตลาด · ต้นฉบับและหลักฐานรายบรรทัดอยู่ใน docs/competitive/ ของ repo · D7 Traction = 1 ทุกแอป (ยังไม่มีผู้ใช้ภายนอก) · ← กลับหน้าเทียบ