까

모호한 검색을 위한 벤치마크 프로젝트

· 2026-06-05 (금) 08:00:11 · 142

🚀 프로젝트 소개

VibeSearchBench는 모호하고 다중 턴의 능동적인 검색을 위한 가장 어려운 벤치마크입니다. 200개의 장기 과제를 통해 사용자의 페르소나에 기반한 점진적 정보 공개를 평가하며, 검증 가능한 스키마 없는 지식 그래프 평가를 제공합니다.

✨ 주요 기능

  • 200개의 다양한 검색 과제 제공
  • 페르소나 기반의 점진적 정보 공개
  • 검증 가능한 지식 그래프 평가 방식

🛠️ 기술 스택

이 프로젝트는 Python으로 개발되었으며, LLM(대형 언어 모델)을 활용하여 지식 그래프를 평가합니다.

💡 활용 방법

개발자는 이 프로젝트를 통해 능동적인 검색 에이전트를 개발하고, 다양한 검색 시나리오에서 성능을 평가할 수 있습니다.

📄 Original (English)

About

🔍 The hardest search benchmark in the wild — vague, multi-turn, proactive. 200 long-horizon tasks with persona-driven progressive disclosure, scored by verifiable schema-free knowledge-graph evaluation. No vibes, just triplet F1.

README

VibeSearchBench

Hardest — vague multi-turn proactive search in the wild. Verifiable — schema-free knowledge graph evaluation. Long-horizon — persona-driven progressive disclosure.


Leaderboard

Browse the full leaderboard and multi-turn task trajectories at vibebench.github.io/VibeSearchBench.github.io.

Evaluation:

  • Primary metric: Triplet F1. Predicted knowledge graphs are matched against ground truth via LLM-as-judge node alignment and triplet semantic equivalence.
  • Multi-turn interaction. Each task uses a persona-driven user simulator with progressive disclosure; agents may search, visit pages, and run code across many turns.
  • Best reported score: 30.3 triplet F1 (Claude Opus 4.6, OpenClaw).

Tasks

200 tasks across 2 subsets and 20 domains. Each task pairs a vague initial query with a ground-truth knowledge graph.

| Split | Count | Description |

License

MIT License

|
댓글을 작성하시려면 로그인이 필요합니다.

AI

624건
+
제목 글쓴이 날짜 조회
06-11 조회 265
06-10 조회 116
06-09 조회 127
06-09 조회 211
06-08 조회 134
06-07 조회 154
06-07 조회 196
06-06 조회 130
06-05 조회 126
06-05 조회 143
06-04 조회 136
06-04 조회 137
06-03 조회 130
06-03 조회 146
06-02 조회 130
06-02 조회 126
06-01 조회 143
05-31 조회 155
05-31 조회 145
05-31 조회 209
05-30 조회 146
05-29 조회 164
05-28 조회 131
05-27 조회 165
05-27 조회 789
05-26 조회 145
05-23 조회 208
05-23 조회 390
05-22 조회 161
05-21 조회 244