Commit ec97a80c by wangchenglong

update.

parent e0cbf47a
\begin{thebibliography}{102}
\begin{thebibliography}{104}
\providecommand{\natexlab}[1]{#1}
\providecommand{\url}[1]{\texttt{#1}}
\expandafter\ifx\csname urlstyle\endcsname\relax
......@@ -37,10 +37,15 @@ Jane Bromley, Isabelle Guyon, Yann LeCun, Eduard S{\"a}ckinger, and Roopak Shah.
\newblock Signature verification using a" siamese" time delay neural network.
\newblock \emph{Advances in neural information processing systems}, 6, 1993.
\bibitem[Chen et~al.(2023)Chen, Borgeaud, Irving, Lespiau, Sifre, and Jumper]{chen-etal:2023accelerating}
\bibitem[Chen et~al.(2023{\natexlab{a}})Chen, Shu, Shareghi, Collier, Narasimhan, and Yao]{chen-etal:fireact}
Baian Chen, Chang Shu, Ehsan Shareghi, Nigel Collier, Karthik Narasimhan, and Shunyu Yao.
\newblock Fireact: Toward language agent fine-tuning.
\newblock \emph{arXiv preprint arXiv:2310.05915}, 2023{\natexlab{a}}.
\bibitem[Chen et~al.(2023{\natexlab{b}})Chen, Borgeaud, Irving, Lespiau, Sifre, and Jumper]{chen-etal:2023accelerating}
Charlie Chen, Sebastian Borgeaud, Geoffrey Irving, Jean-Baptiste Lespiau, Laurent Sifre, and John Jumper.
\newblock Accelerating large language model decoding with speculative sampling.
\newblock \emph{ArXiv preprint}, abs/2302.01318, 2023.
\newblock \emph{ArXiv preprint}, abs/2302.01318, 2023{\natexlab{b}}.
\newblock URL \url{https://arxiv.org/abs/2302.01318}.
\bibitem[Chen et~al.(2024)Chen, Li, Yan, Wang, Gunaratna, Yadav, Tang, Srinivasan, Zhou, Huang, and Jin]{chen-etal:2023alpagasus}
......@@ -552,16 +557,21 @@ Duzhen Zhang, Yahan Yu, Jiahua Dong, Chenxing Li, Dan Su, Chenhui Chu, and Dong
\newblock Mm-llms: Recent advances in multimodal large language models.
\newblock \emph{arXiv preprint arXiv:2401.13601}, 2024{\natexlab{a}}.
\bibitem[Zhang et~al.(2024{\natexlab{b}})Zhang, Hosseini, Bansal, Kazemi, Kumar, and Agarwal]{zhang-etal:2024generative}
\bibitem[Zhang et~al.(2024{\natexlab{b}})Zhang, Lan, Murthy, Liu, Yao, Zhu, Tan, Hoang, Liu, Yang, et~al.]{zhang-etal:agentohana}
Jianguo Zhang, Tian Lan, Rithesh Murthy, Zhiwei Liu, Weiran Yao, Ming Zhu, Juntao Tan, Thai Hoang, Zuxin Liu, Liangwei Yang, et~al.
\newblock Agentohana: Design unified data and training pipeline for effective agent learning.
\newblock \emph{arXiv preprint arXiv:2402.15506}, 2024{\natexlab{b}}.
\bibitem[Zhang et~al.(2024{\natexlab{c}})Zhang, Hosseini, Bansal, Kazemi, Kumar, and Agarwal]{zhang-etal:2024generative}
Lunjun Zhang, Arian Hosseini, Hritik Bansal, Mehran Kazemi, Aviral Kumar, and Rishabh Agarwal.
\newblock Generative verifiers: Reward modeling as next-token prediction.
\newblock \emph{ArXiv preprint}, abs/2408.15240, 2024{\natexlab{b}}.
\newblock \emph{ArXiv preprint}, abs/2408.15240, 2024{\natexlab{c}}.
\newblock URL \url{https://arxiv.org/abs/2408.15240}.
\bibitem[Zhang et~al.(2024{\natexlab{c}})Zhang, Hosseini, Bansal, Kazemi, Kumar, and Agarwal]{zhang-etal:zhang2024generative}
\bibitem[Zhang et~al.(2024{\natexlab{d}})Zhang, Hosseini, Bansal, Kazemi, Kumar, and Agarwal]{zhang-etal:zhang2024generative}
Lunjun Zhang, Arian Hosseini, Hritik Bansal, Mehran Kazemi, Aviral Kumar, and Rishabh Agarwal.
\newblock Generative verifiers: Reward modeling as next-token prediction.
\newblock \emph{arXiv preprint arXiv:2408.15240}, 2024{\natexlab{c}}.
\newblock \emph{arXiv preprint arXiv:2408.15240}, 2024{\natexlab{d}}.
\bibitem[Zhao et~al.(2024)Zhao, Lin, Zhu, Ye, Chen, Zheng, Ceze, Krishnamurthy, Chen, and Kasikci]{zhao-etal:2024atom}
Yilong Zhao, Chien-Yu Lin, Kan Zhu, Zihao Ye, Lequn Chen, Size Zheng, Luis Ceze, Arvind Krishnamurthy, Tianqi Chen, and Baris Kasikci.
......
@article{zhang-etal:agentohana,
title={Agentohana: Design unified data and training pipeline for effective agent learning},
author={Zhang, Jianguo and Lan, Tian and Murthy, Rithesh and Liu, Zhiwei and Yao, Weiran and Zhu, Ming and Tan, Juntao and Hoang, Thai and Liu, Zuxin and Yang, Liangwei and others},
journal={arXiv preprint arXiv:2402.15506},
year={2024}
}
@article{chen-etal:fireact,
title={Fireact: Toward language agent fine-tuning},
author={Chen, Baian and Shu, Chang and Shareghi, Ehsan and Collier, Nigel and Narasimhan, Karthik and Yao, Shunyu},
journal={arXiv preprint arXiv:2310.05915},
year={2023}
}
@inproceedings{singh-etal:singhagentic,
title={Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning},
author={Singh, Joykirat and Pandya, Yash and Vajreshwari, Pranav and Magazine, Raghav and Nambi, Akshay},
......
No preview for this file type
......@@ -27,7 +27,7 @@ An agent's autonomy refers to its ability to independently determine the steps r
\begin{tcolorbox}[frame empty]
\begingroup
% \setlength{\leftskip}{0.3em}
% \setlength{\leftskip}{-0.3em}
% \setlength{\rightskip}{2em}
\centering
\renewcommand{\arraystretch}{1.5}
......@@ -45,6 +45,13 @@ $\cdots \cdots$
\end{tcolorbox}
\begin{figure}
\centering
\caption{111}
\label{fig:agent-planning-sft}
\end{figure}
One commonly used approach to improve the planning capability of LLM-based agents is instruction tuning \citep{chen-etal:fireact,zhang-etal:agentohana}. As illustrated in Figure \ref{fig:agent-planning-sft}, this process typically consists of three stages: (i) preparing environments and planning tasks; (ii) synthesizing expert-level trajectories, which consist of sequences of action-observation pairs, on these tasks; and (iii) instruction-tuning LLMs using the synthesized trajectory data. Specifically, expert trajectories can be generated by leveraging state-of-the-art LLMs as agent policies and selecting high-quality trajectories based on predefined reward signals or task success criteria. Through this process, LLMs can acquire planning behaviors from demonstrations and improve their ability to generate structured execution plans.
% 先讲述使用SFT来去提升、然后再讲述与环境进行交互,之后再讲述搜索(这一部分可以重点讲述一下如何构建reward function)
......@@ -62,11 +69,12 @@ $\cdots \cdots$
\subsubsection{Trajectory Refinement}
% 在这里做一个总结,整个大一点的图来去描述整体agent的运作
% 在这里做一个总结,整个大一点的图来去描述整体agent的运作,并且描述使用强化学习可以来优化哪些模块。
\subsection{Better Environments}
\subsection{Improved Environments}
\subsubsection{Scaling Up }
......
Markdown 格式
0%
您添加了 0 到此讨论。请谨慎行事。
请先完成此评论的编辑!
注册 或者 后发表评论