測試與監控已停止 · 原作保留

五模型,兩輪作品的實際結果

共封存 17 / 20 份原作;封存包含有缺陷的作品,不等於全部功能合格。本次綜合交付與第二輪改善,以 Muse 免費版最均衡。

2026-09-07:依使用者要求停止後續測試,三分鐘監控已停用。保留 17 / 20 份正式原作:鵜鶘 9 / 10,飛行遊戲 8 / 10。封存數包含功能有缺陷的模型原作,不能當成全部通過的數量。未完成草稿、原始片段及失敗嘗試另存,不充當完成版本。

模型與執行方式思考請求鵜鶘飛行遊戲本次判斷
Gemini 3.8 Flash / agy CLIhigh2 / 22 / 2場景與介面細節豐富,第二輪遊戲功能改善,但主機被巨大尾焰遮擋、手機裁切仍明顯。
Muse Spark 1.3 / OpenCode 免費版xhigh2 / 22 / 2本次交付與修正最均衡;第二輪飛行遊戲修好暫停、手機射擊及控制列布局。
Qwen 3.8 Flash / OpenRouterxhigh1 / 20 / 2首份鵜鶘成功,後續請求等待上游回應;無法以未完成結果評定繪圖或遊戲能力。
GLM 5.3 Flash / OpenRoutermax2 / 22 / 2重新評測後已完成四份;飛行第二輪修好全畫面暫停,正常輸入已能達勝利,手機 HUD 仍重疊。
本機 Qwen 3.8 27B IQ3_S / llama.cppxhigh2 / 22 / 2鵜鶘第二輪姿勢有改善;飛行首版黑畫面,補交第二版可操作,但暫停、恢復按鈕與飛機辨識仍有問題。

若只選一組繼續做這類小型互動作品,我會先選 Muse 免費版:這是本次交付與改進表現的主觀綜合判斷,不是普遍模型排名。若重視本機離線,IQ3_S 已證明能產出,但仍需要人工驗收。

第二輪到底改進了什麼

Muse:飛行 QA 由 25 / 27 到 27 / 27;全畫面暫停與手機射擊修復,射擊、飛彈與方向鍵進入手機首屏。固定操作約 18.67 秒獲勝。仍有兩則 touchcancel Console 訊息。鵜鶘第二輪布局更緊湊,但桌機新增白邊,不能稱全面變好。

Gemini:飛行原先未觀察到飛彈、命中與擊落,第二輪已觀察到,27 項檢查均 true,固定序列約 4.51 秒獲勝。巨大青白尾焰反而更遮機體;未鎖定就可追蹤發射的規則偏差有讀碼線索,但未獨立操作確認。鵜鶘手機車輪比例修正,畫布可暫停,但頁首圖示仍動畫。

GLM:飛行首版固定序列 90 秒未命中/擊落而失敗,第二輪 27 項檢查均 true、約 71.83 秒達 5 擊落獲勝;手機上方生命/時間/暫停仍重疊。鵜鶘全新兩輪均通過動畫、全畫面暫停與恢復,暖色海岸、米白鵜鶘、紅圍巾和紅車架清楚。

本機 IQ3_S:飛行首版 crR 未定義造成畫面失效;第二版修復,26 / 27 項 true。暫停狀態與時鐘停住,但整幅畫面未完全凍結;恢復按鈕受攔截,使用 P 才恢復。固定操作約 21.02 秒以生命 0、擊落 3 架失敗,尚未證明可以贏。鵜鶘由喙朝上改朝前,騎乘姿勢更清楚,手機主角仍偏小。

雲端 Qwen:鵜鶘首版動畫/暫停/恢復正常,線條較簡單、手機留白較多。第二版只留下 28,595 bytes 未完成草稿;飛行留下 7 個原始程式片段,共 45,547 bytes,尚未組成最終 HTML。沒有拿草稿或重複首版補數。

QA 勝利時間只是一次固定正常輸入的結果,不是難度、遊戲手感或模型推論速度排名;27 個 true 也不涵蓋所有規則、視覺與真實手機情境。

各次交付經過時間

下表只列採用版本的任務經過時間。包含思考、工具、等待與自檢;先前失敗另保留,這不是所有嘗試的總成本,也不是 tokens/s 或 runtime 跑分。

模型鵜鶘第一輪鵜鶘第二輪飛行第一輪飛行第二輪
Gemini35分40秒8分54秒36分56秒10分16秒
Muse 免費版6分49秒8分10秒6分35秒7分16秒
雲端 Qwen11分52秒未完成,已停止未完成,已停止未啟動,已停止
GLM 全新評測/補交45分26秒23分18秒53分58秒33分42秒
本機 IQ3_S4分7秒7分55秒8分35秒(有缺陷)12分39秒(補交)

Context、IQ4 與雲端 Qwen

本機正式採用 IQ3_S / 65,536 context / Q8 KV / MTP 2。IQ4 在改用官方 thinking 取樣後曾交出首版,但 40K 第二輪仍以 length 結束;換 IQ3 後才完成獨立兩輪。IQ4 的歷史原作與失敗沒有刪除,也沒有改標成 IQ3。IQ3 飛行第二轮也曾用滿 64K,精簡重複 QA 提示後補交,這個條件差異有公開保留。

雲端 Qwen 最後成功 prompt 約 87K / 93K,設定是 1M;沒有 context overflow 證據。微小直接 API 請求也可卡在「資料送出後等待 HTTP 回應標頭」,同時同金鑰的 GLM 可完成。早期 32K output 曾成功,但後續也等待,不能宣稱降到 32K 已可靠修好。最有力的定位是 OpenRouter 的 Qwen/Alibaba 請求路徑,內部哪層原因仍未確證。詳細原始診斷見 diagnostics/cloud-qwen-20260907/DIAGNOSIS.zh-TW.md

本次維持各工具可設定的最高思考請求,並未設定模型 elapsed timeout;不同工具、提示、context/output、重試與讀圖可用性仍有差異。它比較的是這套實際工作流程的交付結果,無法據此判定哪個 runtime 純推論最快。

保留的作品

鵜鶘動態作品集 · HTML、快照與紀錄 ZIP

飛行遊戲作品集 · HTML、快照與紀錄 ZIP

作品頁保留兩版比較、可播放原作、手機/桌機快照、公開 QA 和來源 hashes。私有模型思考、原始 logs、認證資料與未完成草稿沒有放進公開作品包。停止由使用者提出,並未被記成模型正常交件或 provider timeout。