←── back to feed
/topics/arxiv-ai-agent-research-papers-august-5

arXiv AI agent research papers August 5

30 items1 sourcesupdated 1d agotrend 1

On August 5, 2026, arXiv published 20 papers on AI agent research spanning medical reasoning, time-series forecasting, CAD generation, tool-use parameter optimization, multi-agent economics, reinforcement learning, memory management, and adversarial testing. The papers address core agent challenges: grounding decisions in evidence, handling long-horizon interactions, maintaining consistency under pressure, and improving reasoning beyond average-case performance.

  • MedPIC-Bench evaluates whether models use patient-specific information to apply medication-safety rules correctly, not just recall drug-risk associations.
  • CastFSR framework adds explicit context identification and temporal constraint validation to LLM-based time-series forecasting.
  • TraceCAD preserves repair history and failed outcomes as persistent state to improve LLM-based CAD agent correction loops.
  • OM-GRPO decouples reward estimation from policy optimization in label-free reinforcement learning to prevent answer-token reinforcement shortcuts.
  • TumorBoard multi-agent system coordinates radiology, pathology, and molecular diagnosis with auditable claim-evidence ledgers and adversarial critic oversight.
  • The Agent Operating System (AOS) proposes a reference architecture for distributed agentic systems independent of specific framework implementations.
[BLG]blog/rss30
Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning
arXiv cs.AI · Zhitian Hou, Yuhang Liu, Pengkai Wang, Zeyu Liu, Guanghao Zhu, Zheng Liu, Shuo Cai, Congkai Xie, Zhijie Sang, Kun Zeng, Hongxia Yang · 1d
CastFSR: A Fast--Slow--Reflect Agentic Reasoning Framework for Context-Aware Time Series Forecasting
arXiv cs.AI · Xiaoyu Tao, Mingyue Cheng, Bokai Pan, Chuang Jiang, Huanjian Zhang, Tian Gao, Yaguo Liu, Qi Liu, Enhong Chen · 1d
TraceCAD: Trace-Guided Repair for Agentic CAD Generation
arXiv cs.AI · Fengxiao Fan, Jingzhe Ni, Fan Sang, Xiaolong Yin, Yu Liu, Ruofeng Tong, Min Tang, Peng Du · 1d
Getting the Parameters Right: A Difficulty-Graded Benchmark and Probe-Guided Training for LLM Tool Calls
arXiv cs.AI · Guoyao Yu, Xiaoqing Sun, Ziqi Huang, Shaojing Fan, Zhongyi Zhang, Xiaomeng Hu, Xiaobo Xue, Yangyang Shi, Xiong Xiao, Yang Song, Biao Lyu, Rong Wen, Xing Li, Qinming He, Shunming Zhu, Zhenguang Liu · 1d
AI Agent Economics: Can Autonomous Economic Behavior Emerge among AI Agents under Minimal External Conditions?
arXiv cs.AI · Lingyun Zhang, Shang Shang · 1d
Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR
arXiv cs.AI · Yongshi Ye, Liang Zhang, Yidong Chen, Xiaodong Shi, Biao Fu · 1d
Beyond Average Performance: Dynamic Instance Clustering and Specialized Algorithm Design in LLM-Assisted Evolutionary Search
arXiv cs.AI · Qinglong Hu, Qingfu Zhang, Fei Liu, Xialiang Tong, Kun Mao, Mingxuan Yuan · 1d
Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents
arXiv cs.AI · Xiaolong Sun, Qichao Wang, Hangyu Li, Liang Chen · 1d
Spatial proteomics guided by H&E-based AI reveals recurrence-risk niches in triple-negative breast cancer
arXiv cs.AI · Yesung Cho, Ji Hwan Park, Chanil Kim, Hyewon Kim, Honglan Li, Yumin Lee, Geongyu Lee, Sujeong Hong, Seong Min Park, Yoonyoung Lee, Hee Sool Rho, Sumin Lee, Amos Chungwon Lee, Changhwan Lee, Hwanyoung Shim, Hyunwook Kim, Hyeji Shin, Sanha Park, Jihoon Yu, Yoon Hee Shin, Sooheon Kim, Hyunjin Park, Seung Min Park, Sangwan Kim, Yujung Kim, Sung-Im Do, Eun-Young Kim, Dongmyung Shin, Jongbae Park, In-Gu Do · 1d
UniGD: A Unified Generative-Discriminative Framework for Industrial Retrieval
arXiv cs.AI · Shujie Ji, Yawei Kong, Yilin Zhao, Li Wang, Xialong Liu, Peng Jiang · 1d
Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning
arXiv cs.AI · Sahil Al Farib, Momota Ahsana Meem, Sheikh Redwanul Islam, Md. Tanvir Raihan · 1d
Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation
arXiv cs.AI · Saqib Shouqi, Abdullah Nazly, Januki Wanniarachchi, Ravisha De Alwis · 1d
Surrogate Substitution Preserves PHI Detectability: A Multi-Detector Equivalence Study
arXiv cs.AI · Qiming Bao, Sherry J. H. Feng, Kim Chester Eugenio, Meng Fon · 1d
Diversity is Not Ambiguity: Toward Accurate and Efficient Ambiguity Detection for Open-Domain QA
arXiv cs.AI · Jiwon Lee, Yong-chan Park, Jungin Hong, U Kang · 1d
TumorBoard: Evidence-Grounded Multi-Agent Decision Support for Longitudinal Neuro-Oncology
arXiv cs.AI · Yantong Liu, Zheyu Zhang, Runpeng Liu, Mu Xitang, Seong-Yoon Shin, Hyun-Ae Lee · 1d
When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models
arXiv cs.AI · Yu Feng, Chunting Zang, Chen Shen, Rui Miao, Ge Teng, Weidong Cai, Jieping Ye · 1d
The Agent Operating System (AOS): A Reference Operating Architecture for Distributed Agentic Systems
arXiv cs.AI · Ankur Sharma, Deep Shah · 1d
Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains
arXiv cs.AI · Yanchao Li, Wanhao Liu, Jiaqing Xie, Ben Gao, Yanbo Wang, Tianfan Fu, Yuqiang Li · 1d
UniNav: A Unified World-Action Diffusion Model for Visual Navigation
arXiv cs.AI · Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen · 1d
One Knob to Rule Them All: A Unified Optimal Transport View of Cold-Start Active Learning
arXiv cs.AI · Ning Zhu, Xiaochuan Ma, Juntao Xu, Jingze Liang, Mengfei Zhao, An Chen, Liang-Jian Deng · 1d
TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning
arXiv cs.AI · Wonpyo Park, Seung-won Hwang · 1d
AgentPanel: Toward a New Paradigm for Human--AI Collaboration in Exploring Scientific Questions
arXiv cs.AI · Zhiyao Cui, Qianyi Wang, Haoyang Yan, Yiqun Zhang, Siyue Ren, Hangfan Zhang, Zelin Tan, Hao Li, Chunjiang Mu, Dexian Cai, Shao Zhang, Chen Zhang, Meng Li, Jianan Chai, Yuting Fan, Zichao Ye, Xiaolei Yang, Xinyao Lu, Yuyang Yu, Wenjie Lou, Xiaosong Wang, Fenghua Ling, Shiyang Feng, Mao Su, Qiaosheng Zhang, Bo Zhang, Yang Chen, Lei Bai, Shuyue Hu · 1d
DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning
arXiv cs.AI · Le Xiang, Zhicheng Guan, Hong Chen, Xiaocong Lin, Zhenghua Lei, Teng Hu, Bolei He, Long Zeng · 1d
Distractor-Aware Truncation: Disentangling Context-Length Effects from Signal Loss in Long-Context LLM Benchmarks
arXiv cs.AI · Mohsen Arjmandi · 1d
SeaSlides: Semantic Abstraction Layer for Agentic Slide Generation
arXiv cs.AI · Shengjun Fang, Chenyang Wu, Zongzhang Zhang · 1d
Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents
arXiv cs.AI · Siqi Fan, Minghao Li, Xiaoqian Ma, Wenhui Tan, Xiusheng Huang, Juntong Wu, Liujie Zhang, Shuo Shang, Weihang Chen · 1d
Long-term Traffic Scene Prediction via Polynomial Representations in Autonomous Driving
arXiv cs.AI · Yue Yao · 1d
Traceable Multi-Agent System for Knowledge-Based Forecasting
arXiv cs.AI · Junhyeok Kang, Sangjun Han, Hyeokjun Choe, Soonyoung Lee · 1d
MMLongBench-Doc-V2: A Corrected-Annotation, Semantics-Aware Revision of MMLongBench-Doc
arXiv cs.AI · Mingtian Zhang · 1d
Towards Robust Tool Use in Agents via Experience-Driven Adaptive Guidance
arXiv cs.AI · Can Wang, Haoran Chen, Li Yu, Ding Hao, Bohai Zhao, Zhaoyang Liu, Zhiying Tu · 1d