
·AI
我評估咗 7 種語言嘅 40 個 AI 播客。六次管線修復之後——呢度匯報實際改善。
我構建咗一個評估框架,喺 7 種語言嘅 40 個真實集數上為我嘅 AI 播客管線評分。 審查步驟反而令腳本變差(3.34 → 2.91)。所有引用 URL 都睇落係假嘅(得分:1.28)。 中文係最弱嘅語言(2.88)。六項修復、一日同一個新模型之後——呢度係 前後對比數字同我做嘅每一個更改。
呢個標籤共 5 篇文章

我構建咗一個評估框架,喺 7 種語言嘅 40 個真實集數上為我嘅 AI 播客管線評分。 審查步驟反而令腳本變差(3.34 → 2.91)。所有引用 URL 都睇落係假嘅(得分:1.28)。 中文係最弱嘅語言(2.88)。六項修復、一日同一個新模型之後——呢度係 前後對比數字同我做嘅每一個更改。

我花咗幾日時間為AI podcast主持編寫系統提示。佢哋逐字閱讀咗——然後幾乎全部無視晒。解決方案唔係更好嘅措辭——而係明白LLM處理規則嘅方式,取決於規則喺pipeline中嘅位置。

我差啲就為 DIALØGUE 個 iOS app 整咗一個聰明、專門為 AI 而設嘅離線模式。後來我問咗一個更悶嘅問題——iOS 究竟已經畀咗啲乜嘢我?——結果先發現,真正嘅工夫係要忍住「想表現得聰明」嘅衝動。呢篇就講「下載一集,然後喺飛機上聽」背後嗰套標準、毫不華麗嘅機制,以及點解揀悶嗰條路先至係老手嘅決定。

幾個月前,我將 DIALØGUE 個 iOS app 當成 web 版嘅移植咁出咗街,之後又幾乎全部重做成一個真正 native 嘅 app——三個 tab、上鎖畫面音頻、同步字幕、捱得住爛網絡嘅 offline,仲有 Siri——因為一個被壓細塞入手機嘅 web app,講到尾都仲係一個 web app。

我 push 咗一個本來應該係升級嘅改動去我嘅 podcast 平台語音系統。 六日之後,幾幾個 commit 之後,我刪走咗 2,724 行 code,rollback 返去之前用到嘅版本。 以下係成件事嘅經過,以及佢教我關於測試 production AI 改動嘅教訓。