
·AI
我评估了 7 种语言的 40 个 AI 播客。六次管线修复之后——这里汇报实际改善。
我构建了一个评估框架,在 7 种语言的 40 个真实剧集上为我的 AI 播客管线打分。 审查步骤反而让脚本变差(3.34 → 2.91)。所有引用 URL 看起来都是假的(得分:1.28)。 中文是最弱的语言(2.88)。六项修复、一天和一个新模型之后——这里是 前后对比数字和我所做的每一个更改。
此标签共 2 篇文章

我构建了一个评估框架,在 7 种语言的 40 个真实剧集上为我的 AI 播客管线打分。 审查步骤反而让脚本变差(3.34 → 2.91)。所有引用 URL 看起来都是假的(得分:1.28)。 中文是最弱的语言(2.88)。六项修复、一天和一个新模型之后——这里是 前后对比数字和我所做的每一个更改。

我花了几天时间为AI播客主持人编写系统提示词。他们逐字阅读了——然后几乎全部无视了。解决方案不是更好的措辞——而是理解LLM对规则的处理方式取决于规则在管道中的位置。