SWE-bench

GitHub Issueの解決能力を用いてAIのコーディング性能を測る標準テスト。

「SWE-bench」を全文検索でも探す →

LISTENverse

拡大するとさらに表示 · 0 本

AI開発のタスク管理はGitHub Issue|リンクを渡すだけでAIが対応

超実践AI論

【目次】 00:00 オープニング 00:38 AI開発と相性がいい理由 01:04 自社サイトでの実例 01:43 GitHub Issueを検討しよう 今回の内容の解説記事 ⁠https://hataracraft.com/articles/github-issue-ai-development AI・IT・業務改善の無料相談はこちら ⁠⁠https://hataracraft.com/booking

42【圧倒的性能】Claude Fable 5のファーストインプレッション

AI駆動開発部の日常

本エピソードでは、Anthropicがリリースした最新モデル「Claude Fable 5」のファーストインプレッションを共有します。Claude Fable 5は、前身モデル「Mythos」の高度な能力を引き継ぎつつ、安全面に配慮して一般公開されたモデルです。100万トークンのコンテキストウィンドウを持ち、特にSWE-bench ProやGDPval-AAといったベンチマークで飛躍的...

エピソードを読み込んでいます…