
·AI
7言語で40本のAIポッドキャストを評価した。6つのパイプライン修正で、何が改善したか。
7言語40本の実エピソードでAIポッドキャストパイプラインを評価するフレームワークを構築した。 レビューステップがスクリプトを悪化させていた(3.34 → 2.91)。引用URLはすべて偽物に見えた(スコア: 1.28)。 中国語が最も弱いロケールだった(2.88)。6つの修正、1日、そして新しいモデルの後 — これが ビフォー/アフターの数字と、私が行ったすべての変更だ。
このタグの記事 2件

7言語40本の実エピソードでAIポッドキャストパイプラインを評価するフレームワークを構築した。 レビューステップがスクリプトを悪化させていた(3.34 → 2.91)。引用URLはすべて偽物に見えた(スコア: 1.28)。 中国語が最も弱いロケールだった(2.88)。6つの修正、1日、そして新しいモデルの後 — これが ビフォー/アフターの数字と、私が行ったすべての変更だ。

AIポッドキャストのホストのために、何日もかけてシステムプロンプトを作り込みました。彼らは一字一句読みましたが、ほぼすべて無視しました。解決策は「より良い言葉」ではなく——LLMがパイプライン内のどこにルールを配置するかによって、ルールの処理の仕方が根本的に変わるという理解でした。