Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation
Focuses on Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation.
Topic archive
Tool use, planning, orchestration, and agent workflows. This page collects the latest briefings that match the topic so readers can follow one area without scanning the full feed.
Indexed briefings
973
Latest source-linked updates, ordered newest first.
Latest
Focuses on Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation.
Focuses on CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?.
Focuses on The Rise of Verbal Reinforcement Learning.
Focuses on Mechanism Design for Alignment and Control.
Focuses on Designing Proactive Thought Partners for Writing.
Focuses on Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers.
Focuses on Retrieved but not ranked: surface-form bias in structural retrieval, from mathematics to agent trajectories.
Focuses on NashDreamer: Model-Based Reinforcement Learning for Zero-Sum Imperfect-Information Games.
Focuses on EvoSCM: Scientific Belief Revision Through Causal Model Evolution and Experimentation.
Basis, Clay, and Exa Labs use AI agents to improve onboarding, account management, and developer integrations.
Focuses on When Guardrails Look Effective: Construct Validity Failures in LLM Agent Commerce Evaluation.
Focuses on DIASENTINEL: An Auditable Multi-Agent System for Guideline-Grounded Diabetes Risk Screening.
Focuses on GlossoGen: Emergent Language in Complex Multi-Agent LLM Interactions.
Focuses on Aspire: Can Models Self-Evolve from Vague Goals?.
Focuses on Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents.
Focuses on Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement.
Focuses on S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?.
Focuses on Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers.
Focuses on Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data.
Focuses on HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?.
Focuses on Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization.
Focuses on TRIAGE: Three-level Routing and Intelligent Agent Guidance for Efficient Execution.
Focuses on Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents.
Focuses on Provably Safe Sim-to-Real Transfer.
Focuses on Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence.
Focuses on EdiTikZ: Scientific Figure Editing from Revision Trajectories.
Focuses on Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents.
Focuses on Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching.
Focuses on Logos: An Agent Harness on a Cross-Process Bus.
Focuses on Autonomous robotic bridging using distributed swarm control without inter-agent communication.
Focuses on InSight: A Benchmark for Agentic Claim Verification in Interactive Visualizations.
Focuses on On the Maintenance and Co-evolution of Agent Plugins: An Empirical Study of Claude Code Plugin Marketplaces.
Focuses on Analytic Dynamics: Learning Physics-Grounded Representation for Fast Intrinsic Dynamics Inference from Monocular Videos.
Focuses on EDGE: Error Dependency Graph-Guided Multi-Error Attribution in Multi-Agent LLM Systems.
Focuses on MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents.
Focuses on LEAP: Likelihood Elicitation and Aggregation for LLM-based Probabilistic Forecasting.