Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation
Clinical and bio workflows punish fragile models quickly. - Evaluating software engineering agents on realistic benchmarks is costly, since each task may require multi-step code exploration, modification, and test execution.

