ɔhobisuke

@tadachobi.bsky.social

https://tadachobi.com/

某ストリーミングサービスが「去年末以来、人間のエンジニアはコードを書いてません」とか「毎日何千回も本番デプロイしてます」とか言ってて、一向にユーザー体験が向上しないのは何故だろう。 施策策定段階で「その程度の機能改修に何の価値があるの?それより、こっちのイケてる機能でしょ」って突っぱねられてるのかもしれないけど、それなら何を「毎日何千回も本番デプロイ」してるんだ? またメトリクス設計を誤ってるとか、そういう話なのかな…

高性能なモデルはコーディングベンチマークをうまくハックする。自力で答えを導き出さず、単に調べて取得してしまう。git の履歴を遮断し、インターネットへのアクセスを制限するとスコアが大きく低下した Reward hacking is swamping model intelligence gains · Cursor htn.to/3koizgr5Q4

報酬ハッキングがモデルの知能向上を食い潰している · Cursor

SWE-bench Pro では、成功した Opus 4.8 Max の解決の 63% が、修正を導き出したのではなく取得したものでした。より厳格な eval ハーネスによって、ベンチマークスコアがコーディング能力と答えのリトリーバルを混同しうることがわかります。

htn.to

「SQLite」データベースやSSDの状態を確認する限り、自分は大丈夫そう。パワーユーザーが影響を受けやすいのかな? 「Codex」がSSDを酷使? 年間換算で約640TB書き込み、寿命を1年足らずで使い切るおそれ - やじうまの杜 - 窓の杜 forest.watch.impress.co.jp/docs/serial/...

「Codex」がSSDを酷使? 年間換算で約640TB書き込み、寿命を1年足らずで使い切るおそれ/今後のアップデートは早めに適用した方がいいかも【やじうまの杜】

「やじうまの杜」では、ニュース・レビューにこだわらない幅広い話題をお伝えします。

forest.watch.impress.co.jp

AIに書いてもらってるから、辿々しいプレゼンになるのか。 自分で書き起こしたものを読むとなると、スムーズに言葉が出てくるのか。 ※自分の口調を真似るようにAIに指示を出してたら、もう少しマシになってくるかもだけど。