Commit 759c7625 by wangchenglong

update.

parent 6de2c269
\begin{thebibliography}{173}
\begin{thebibliography}{175}
\providecommand{\natexlab}[1]{#1}
\providecommand{\url}[1]{\texttt{#1}}
\expandafter\ifx\csname urlstyle\endcsname\relax
......@@ -319,10 +319,15 @@ Hunter Lightman, Vineet Kosaraju, Yuri Burda, Harrison Edwards, Bowen Baker, Ted
\newblock In \emph{The Twelfth International Conference on Learning Representations, {ICLR} 2024, Vienna, Austria, May 7-11, 2024}. OpenReview.net, 2024{\natexlab{b}}.
\newblock URL \url{https://openreview.net/forum?id=v8L0pN6EOi}.
\bibitem[Liu et~al.(2026)Liu, Wang, Wu, Huang, Li, Jiao, and Zhang]{liu-etal:agentic}
\bibitem[Liu et~al.(2026{\natexlab{a}})Liu, Liu, Liang, Li, Liu, Wang, Wan, Zhang, and Ouyang]{liu-etal:flow}
Jie Liu, Gongye Liu, Jiajun Liang, Yangguang Li, Jiaheng Liu, Xintao Wang, Pengfei Wan, Di~Zhang, and Wanli Ouyang.
\newblock Flow-grpo: Training flow matching models via online rl.
\newblock \emph{Advances in neural information processing systems}, 38:\penalty0 40783--40818, 2026{\natexlab{a}}.
\bibitem[Liu et~al.(2026{\natexlab{b}})Liu, Wang, Wu, Huang, Li, Jiao, and Zhang]{liu-etal:agentic}
Xiaoqian Liu, Ke~Wang, Yuchuan Wu, Fei Huang, Yongbin Li, Jianbin Jiao, and Junge Zhang.
\newblock Agentic reinforcement learning with implicit step rewards.
\newblock In \emph{International Conference on Learning Representations}, volume 2026, pp.\ 129271--129291, 2026.
\newblock In \emph{International Conference on Learning Representations}, volume 2026, pp.\ 129271--129291, 2026{\natexlab{b}}.
\bibitem[Liu et~al.(2023)Liu, Iter, Xu, Wang, Xu, and Zhu]{liu-etal:2023GEval}
Yang Liu, Dan Iter, Yichong Xu, Shuohang Wang, Ruochen Xu, and Chenguang Zhu.
......@@ -772,6 +777,11 @@ Tong Xiao and Jingbo Zhu.
\newblock \emph{ArXiv preprint}, abs/2501.09223, 2025.
\newblock URL \url{https://arxiv.org/abs/2501.09223}.
\bibitem[Xiao et~al.(2026)Xiao, Ruan, Li, Yu, Zhang, and Zhu]{xiao-etal:ordinary}
Tong Xiao, Junhao Ruan, Bei Li, Zhengtao Yu, Min Zhang, and Jingbo Zhu.
\newblock Ordinary differential equations in vision and language.
\newblock 2026.
\bibitem[Xie et~al.(2025)Xie, Gao, Ren, Luo, Hong, Dai, Zhou, Qiu, Wu, and Luo]{xie-etal:2025logic}
Tian Xie, Zitian Gao, Qingnan Ren, Haoming Luo, Yuqian Hong, Bryan Dai, Joey Zhou, Kai Qiu, Zhirong Wu, and Chong Luo.
\newblock Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning.
......
......@@ -4,6 +4,23 @@
@article{liu-etal:flow,
title={Flow-grpo: Training flow matching models via online rl},
author={Liu, Jie and Liu, Gongye and Liang, Jiajun and Li, Yangguang and Liu, Jiaheng and Wang, Xintao and Wan, Pengfei and Zhang, Di and Ouyang, Wanli},
journal={Advances in neural information processing systems},
volume={38},
pages={40783--40818},
year={2026}
}
@article{xiao-etal:ordinary,
title={Ordinary Differential Equations in Vision and Language},
author={Xiao, Tong and Ruan, Junhao and Li, Bei and Yu, Zhengtao and Zhang, Min and Zhu, Jingbo},
year={2026},
publisher={TechRxiv}
}
@article{zhou-etal:learning,
title={Learning implicit credit assignment for cooperative multi-agent reinforcement learning},
author={Zhou, Meng and Liu, Ziyu and Sui, Pengwei and Li, Yixuan and Chung, Yuk Ying},
......
Markdown 格式
0%
您添加了 0 到此讨论。请谨慎行事。
请先完成此评论的编辑!
注册 或者 后发表评论