
7言語で40本のAIポッドキャストを評価した。6つのパイプライン修正で、何が改善したか。
7言語40本の実エピソードでAIポッドキャストパイプラインを評価するフレームワークを構築した。 レビューステップがスクリプトを悪化させていた(3.34 → 2.91)。引用URLはすべて偽物に見えた(スコア: 1.28)。 中国語が最も弱いロケールだった(2.88)。6つの修正、1日、そして新しいモデルの後 — これが ビフォー/アフターの数字と、私が行ったすべての変更だ。
このタグの記事 5件

7言語40本の実エピソードでAIポッドキャストパイプラインを評価するフレームワークを構築した。 レビューステップがスクリプトを悪化させていた(3.34 → 2.91)。引用URLはすべて偽物に見えた(スコア: 1.28)。 中国語が最も弱いロケールだった(2.88)。6つの修正、1日、そして新しいモデルの後 — これが ビフォー/アフターの数字と、私が行ったすべての変更だ。

AIポッドキャストのホストのために、何日もかけてシステムプロンプトを作り込みました。彼らは一字一句読みましたが、ほぼすべて無視しました。解決策は「より良い言葉」ではなく——LLMがパイプライン内のどこにルールを配置するかによって、ルールの処理の仕方が根本的に変わるという理解でした。

DIALØGUEのiOSアプリのために、僕はもう少しで、賢くてAIに特化したオフラインモードを作るところでした。でも、もっと地味な問いを立ててみたんです——iOSはもう何を用意してくれているんだろう?——すると、本当に大変だったのは「賢くありたい」という衝動を抑えることでした。「エピソードをダウンロードして飛行機の中で聴く」の裏にある、標準的でまったく華のない仕組みと、なぜ地味を選ぶのがベテランの判断だったのかについて書きます。

DIALØGUEのiOSアプリを、最初はWeb版の移植としてリリースしました。そのあとネイティブで作り直しました。 3つのタブ、ロック画面の音声、同期する文字起こし、しぶといオフライン、そしてSiri。 スマホのサイズに縮めただけのWebアプリは、結局のところまだWebアプリだからです。

ポッドキャストプラットフォームの音声システムをアップグレードするつもりで変更をデプロイした。 6日と数コミット後、2,724行のコードを削除して安定版にロールバックした。 これが実際に起きたことと、productionのAI変更にテストをどう扱うべきかについて学んだことだ。