
·AI
我评估了 7 种语言的 40 个 AI 播客。六次管线修复之后——这里汇报实际改善。
我构建了一个评估框架,在 7 种语言的 40 个真实剧集上为我的 AI 播客管线打分。 审查步骤反而让脚本变差(3.34 → 2.91)。所有引用 URL 看起来都是假的(得分:1.28)。 中文是最弱的语言(2.88)。六项修复、一天和一个新模型之后——这里是 前后对比数字和我所做的每一个更改。
此标签共 5 篇文章

我构建了一个评估框架,在 7 种语言的 40 个真实剧集上为我的 AI 播客管线打分。 审查步骤反而让脚本变差(3.34 → 2.91)。所有引用 URL 看起来都是假的(得分:1.28)。 中文是最弱的语言(2.88)。六项修复、一天和一个新模型之后——这里是 前后对比数字和我所做的每一个更改。

我花了几天时间为AI播客主持人编写系统提示词。他们逐字阅读了——然后几乎全部无视了。解决方案不是更好的措辞——而是理解LLM对规则的处理方式取决于规则在管道中的位置。

我差一点就为 DIALØGUE 的 iOS app 做了一个聪明的、专门为 AI 设计的离线模式。后来我问了一个更无聊的问题——iOS 已经给了我什么?——结果发现,真正的工作是克制住"想要聪明"的冲动。这就是"下载一集然后在飞机上听"背后那套标准、毫不光鲜的机制,以及为什么选无聊才是更老练的决定。

几个月前,我把 DIALØGUE 的 iOS app 当成网页版的移植直接发了出去,后来又几乎全部重做成了真正的原生 app——三个 tab、锁屏音频、同步字幕、扛得住糟糕网络的离线、还有 Siri——因为一个被压缩进手机的网页,说到底还是网页。

我给播客平台的语音系统推了一个本该是升级的改动。 六天、几个 commit 之后,我删掉了 2,724 行代码,回滚到了之前能用的版本。 这是事情经过,以及它教给我的关于测试生产环境 AI 改动的教训。