Question
• 作者您好,感谢开源 InternNav 和 DualVLN。
我们按照公开配置完成了两阶段训练:
- Stage 1:R2R 4组视角 + RxR 4组视角 + ScaleVLN 2组视角,均按100%使用;
- Stage 2:R2R、RxR、ScaleVLN各2组视角,每组使用
%30采样;
- 单节点8张80GB GPU;
- per-device batch size为2,gradient accumulation steps为8,global batch size为128;
- Stage 1训练14k steps,Stage 2训练15k steps。
最终在R2R val_unseen上得到SR 57.69、SPL 53.71,与官方SR 64.3、SPL 58.5仍有差距。
想请问官方结果实际使用的训练配置:
- 官方训练是否还混入EnvDrop或general video QA?如果有,大致数据比例是多少?
- 官方最终结果对应的Stage 1和Stage 2分别训练了多少optimizer steps?
- Stage 1的停止条件是论文中的14k steps、Issue中建议的约20k steps,还是按完整epoch训练?
- 官方实际使用的GPU数量、单卡batch size和global batch size是多少?
感谢!
Question
• 作者您好,感谢开源 InternNav 和 DualVLN。
我们按照公开配置完成了两阶段训练:
%30采样;最终在R2R
val_unseen上得到SR 57.69、SPL 53.71,与官方SR 64.3、SPL 58.5仍有差距。想请问官方结果实际使用的训练配置:
感谢!