
·AI
我評估咗 7 種語言嘅 40 個 AI 播客。六次管線修復之後——呢度匯報實際改善。
我構建咗一個評估框架,喺 7 種語言嘅 40 個真實集數上為我嘅 AI 播客管線評分。 審查步驟反而令腳本變差(3.34 → 2.91)。所有引用 URL 都睇落係假嘅(得分:1.28)。 中文係最弱嘅語言(2.88)。六項修復、一日同一個新模型之後——呢度係 前後對比數字同我做嘅每一個更改。
呢個標籤共 2 篇文章

我構建咗一個評估框架,喺 7 種語言嘅 40 個真實集數上為我嘅 AI 播客管線評分。 審查步驟反而令腳本變差(3.34 → 2.91)。所有引用 URL 都睇落係假嘅(得分:1.28)。 中文係最弱嘅語言(2.88)。六項修復、一日同一個新模型之後——呢度係 前後對比數字同我做嘅每一個更改。

我花咗幾日時間為AI podcast主持編寫系統提示。佢哋逐字閱讀咗——然後幾乎全部無視晒。解決方案唔係更好嘅措辭——而係明白LLM處理規則嘅方式,取決於規則喺pipeline中嘅位置。