Macaron-V1-Venti / .eval_results /terminal_bench_2_1.yaml
mindlab-bot's picture
Add TerminalBench 2.1 and SWE Atlas QnA evaluation results (#6)
4d37c3a
Raw
History Blame Contribute Delete
225 Bytes
- dataset:
id: harborframework/terminal-bench-2.0
task_id: terminalbench_2
value: 87.6
source:
url: https://huggingface.co/mindlab-research/Macaron-V1-Venti/blob/main/README.md#evaluation
name: Model Card