Refresh multilingual benchmarks and fix overlapping gold evaluation
Recompute published benchmark results for all default language models, exclude Polish Polimorf, add Hebrew documentation, and record the current benchmark environment. Evaluate repeated surface forms as an overlapping gold cover and publish only applicable metrics for candidate policies.
This commit is contained in:
@@ -87,6 +87,7 @@ nav:
|
||||
- Finnish: benchmarks/languages/finnish.md
|
||||
- French: benchmarks/languages/french.md
|
||||
- German: benchmarks/languages/german.md
|
||||
- Hebrew: benchmarks/languages/hebrew.md
|
||||
- Hungarian: benchmarks/languages/hungarian.md
|
||||
- Italian: benchmarks/languages/italian.md
|
||||
- Norwegian Bokmal: benchmarks/languages/norwegian-bokmal.md
|
||||
|
||||
Reference in New Issue
Block a user