Skip to content

[Question]: Dualvln数据配比 #363

Description

@GodoneZ

Question

• 作者您好,感谢开源 InternNav 和 DualVLN。

我们按照公开配置完成了两阶段训练:

  • Stage 1:R2R 4组视角 + RxR 4组视角 + ScaleVLN 2组视角,均按100%使用;
  • Stage 2:R2R、RxR、ScaleVLN各2组视角,每组使用%30采样;
  • 单节点8张80GB GPU;
  • per-device batch size为2,gradient accumulation steps为8,global batch size为128;
  • Stage 1训练14k steps,Stage 2训练15k steps。

最终在R2R val_unseen上得到SR 57.69、SPL 53.71,与官方SR 64.3、SPL 58.5仍有差距。

想请问官方结果实际使用的训练配置:

  1. 官方训练是否还混入EnvDrop或general video QA?如果有,大致数据比例是多少?
  2. 官方最终结果对应的Stage 1和Stage 2分别训练了多少optimizer steps?
  3. Stage 1的停止条件是论文中的14k steps、Issue中建议的约20k steps,还是按完整epoch训练?
  4. 官方实际使用的GPU数量、单卡batch size和global batch size是多少?

感谢!

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions