# Насколько точен поиск по фото?

Мы измерили это — на фотографиях, которых модель раньше не видела, — сравнив каждую со всей библиотекой видов. Ниже приведены сама цифра, интервал вокруг неё, как она получена и что она не учитывает. Каждая цифра на этой странице — из одного датированного, воспроизводимого измерения.

## Результаты

**Точность top-1:** **72,5%** (95% ДИ 70,2–74,7%)

Единственный лучший результат — правильный вид.

Интервал Вильсона на выборке из 1 531 фотографии. Если повторить измерение много раз, интервалы, построенные таким способом, будут содержать истинную точность в 95% случаев.

- **Точность top-3:** 87,3% — Правильный вид входит в тройку лучших результатов — это более мягкое утверждение, чем top-1, и оно никогда не выдаётся за него.
- **Точность top-5:** 91,2%

Измерено по 1 531 отложенной фотографии, охватывающей 132 вида — каждая сравнивается со всей библиотекой из 152 видов. Этот снимок библиотеки (1 240 изображений) зафиксирован 2026-08-31T08:18:30.295Z; использована модель `bioclip-vit-b16-vision/onnx-fp32/v1`.

## Что именно измеряется

Это распознавание среди 152 видов, а не выбор из нескольких вариантов: каждая отложенная фотография сравнивается со всеми видами библиотеки, включая те, что сами не дали ни одной отложенной фотографии, — они всё равно участвуют как кандидаты, точно как при обычном поиске. Случайное угадывание в такой задаче в среднем дало бы около 0,7%.

- **Засчитывается как верно:** Первая строка — правильный вид.
- **Засчитывается как неверно:** Верна вторая строка. Верен род, но не вид.

## Путь измерения совпадает с реальным поиском

Каждая отложенная фотография проходит тот же путь распознавания, что и обычный поиск: та же модель сопоставления изображений, то же ранжирование — измерение проводится по сохранённому индексу, привязанному к одному снимку библиотеки. Инструмент измерения отказывается выдать число, если используемая модель не совпадает с моделью индекса, а при существенном изменении библиотеки измерение проводится заново — но это стремление, а не автоматическая гарантия.

Мы также посчитали результат тремя способами, потому что усреднение можно выбрать так, чтобы оно льстило цифре. Они расходятся не более чем на 0,4 процентного пункта:

- **По фотографиям** (72,5%) — Каждая фотография учитывается один раз.
- **По видам** (72,9%) — Каждый вид учитывается один раз, поэтому распространённые растения не могут «вытянуть» цифру.
- **Без минимума фотографий** (72,5%) — Пересчитано без минимального числа отложенных фотографий на вид — вид, который иначе выпал бы из подсчёта, всё равно учитывается.

## Фотовыборка

1 531 фотография от 821 фотографа, и вид на каждой подтверждён независимо, а не только заявлен тем, кто её загрузил. Все фотографии — со свободной лицензией: 1 229 CC-BY и 302 CC0.

41% фотографий — культивируемые, горшечные экземпляры, а не дикорастущие: ближайшее доступное в таком масштабе приближение к настоящему фото комнатного растения при свободной лицензии.

Вид на каждой фотографии подтверждён минимум одним человеком, независимым от того, кто её сделал, — никогда не только словом самого автора; у 31% таких фотографий два подтверждения и более.

## Отложено и проверено в момент измерения

Ни одна из этих фотографий не входит в библиотеку, с которой сравнивает поиск. Каждая проверяется на это в момент измерения — по тому самому снимку библиотеки, на основе которого вычислены эти цифры, — а не просто считается отложенной с момента, когда она была собрана.

## Точность коррелирует с глубиной библиотеки

Если разбить измеренные виды по числу эталонных изображений в библиотеке, закономерность видна, но она слабая.

| Изображений в библиотеке | Видов | Top-1 |
| --- | --- | --- |
| 4–6 | 2 | 100,0% |
| 7–9 | 102 | 69,7% |
| 10+ | 28 | 80,4% |

Виды с 7–9 изображениями в библиотеке дают 69,7%, а виды с 10+ изображениями — 80,4%. У диапазона 4–6 результат выглядит лучше всех — 100%, — но это всего 2 вида на 24 фотографиях: шум, а не разворот тренда (корреляция Пирсона r = 0,18 по 132 видам). Эффект глубины библиотеки заметнее всего в разнице между диапазонами: у диапазона 10+ результат на 11 п.п. выше, чем у диапазона 7–9.

## Как выглядят ошибки

| Пара путаницы | Фотографий |
| --- | --- |
| *Adiantum capillus-veneris* → **Ответ:** *Adiantum raddianum* | 10 (2,4% ошибок) |
| *Philodendron erubescens* → **Ответ:** *Philodendron hederaceum* | 9 (2,1% ошибок) |
| *Coleus scutellarioides* → **Ответ:** *Begonia rex-cultorum* | 6 (1,4% ошибок) |
| *Adenium obesum* → **Ответ:** *Impatiens hawkeri* | 5 (1,2% ошибок) |
| *Cereus repandus* → **Ответ:** *Pachycereus pringlei* | 5 (1,2% ошибок) |
| *Dracaena trifasciata* → **Ответ:** *Gasteria bicolor* | 5 (1,2% ошибок) |
| *Mammillaria elongata* → **Ответ:** *Mammillaria matudae* | 5 (1,2% ошибок) |
| Остальные пары | 376 · 89,3% |

Из 1 531 отложенной фотографии 1 110 были определены верно по top-1, 421 (27,5%) — нет. Самая частая ошибка — между близкородственными видами: *Adiantum capillus-veneris* принимали за *Adiantum raddianum*, 10 раз, но на близкородственные пары приходится лишь 23% всех ошибок. Семь пар выше — самые тяжёлые, и вместе они составляют лишь 10,7% ошибок (45 из 421); остальные 305 из 312 различных пар рассредоточены по всей библиотеке, а не сосредоточены в нескольких парах. 25 из 132 измеренных видов показали максимальную точность (100%); ни один вид не показал 0%.

## Что эта цифра не учитывает

6 ограничений, и у каждого указано, в какую сторону оно сдвигает итоговую цифру. Они — часть самого утверждения: цифра, которую можно оспорить, стоит больше, чем круглое число, которому нельзя возразить.

### 01 20 видов участвовали в сравнении, но не были опрошены

У 132 из 152 видов (87%) набралось достаточно независимо подтверждённых отложенных фотографий, чтобы получить оценку. Остальные 20 видов остаются в списке кандидатов, но не дают ни одного вопроса.

**Эффект:** Не измерены, но не исключены — они всё ещё могут стать неверным ответом и учитываются как ошибка, если это происходит. Из них 10 — это неполные (не биномиальные) или сортовые названия в библиотеке, которым не соответствует ни один публичный таксон, 2 совпадают с другим таксоном по идентификатору, 5 не набрали минимума фотографий, а 3 просто не набрали ни одной. Родовые и сортовые записи — как раз то, с чем точная модель справляется хуже всего, поэтому их отсутствие завышает эту цифру.

### 02 Это выбор из 152 вариантов, а не из всего мира

Каждая отложенная фотография ранжируется только среди 152 видов, уже имеющихся в библиотеке. Фотография растения, которого у нас вообще нет, в этот тест не попадает.

**Эффект:** В реальном поиске такая фотография всё равно получит вариант из этих 152 видов — и он будет неверным каждый раз. Эта цифра ничего не говорит о том, как часто так происходит.

### 03 Лицензированные фотографии, а не ваша камера

Эти фотографии сделаны сообществом натуралистов, а не пользователями Verdalia; 41% показывают культивируемый, горшечный экземпляр, а не дикорастущий.

**Эффект:** Считайте эту цифру **верхней границей** точности для реальных пользователей, а не гарантией.

### 04 Одна фотография, один ответ, без второй попытки

Каждая отложенная фотография оценивается сама по себе — без усреднения по нескольким фотографиям одного растения, без пересъёмки, без второго ракурса.

**Эффект:** В реальном поиске у пользователя часто есть вторая попытка — пересъёмка, лучшее освещение. Эта цифра учитывает только первый кадр, поэтому может занижать то, что получает настойчивый пользователь.

### 05 Цифра привязана к снимку библиотеки и будет меняться

72,5% отражает состояние библиотеки на 31 авг. 2026 г.: 152 вида, 1 240 эталонных изображений. Поскольку точность зависит от глубины (69,7% против 80,4%), добавление фотографий к уже имеющимся видам поднимает цифру, а добавление новых видов с малым числом фотографий сначала её снижает.

**Эффект:** Эта страница датирована намеренно. Повторный запуск на новом снимке библиотеки — это намерение, а не автоматическая гарантия: инструмент измерения отказывается смешивать новую модель со старым индексом.

### 06 Одна модель, один прогон

У итоговой цифры есть доверительный интервал.

**Эффект:** У показателей по диапазонам и по отдельным видам его нет — это малые выборки, и они шумные, поэтому относитесь к ним как к ориентиру, а не к точному значению.

## Как это повторить

Всё, что стоит за этими цифрами, открыто: фотовыборка опубликована полностью — каждое наблюдение, его лицензия, фотограф и независимая идентификация, — так что выборку может проверить и заново собрать кто угодно. Чтобы повторить само ранжирование, дополнительно нужен эталонный индекс изображений библиотеки, а он не публикуется.

- [Методика — как построено и посчитано измерение](https://verdalia.app/accuracy/method.md)
- [Фотоманифест — 1 531 строка, по одной на наблюдение](https://verdalia.app/accuracy/heldout-manifest.csv)

Прогон 31 авг. 2026 г. · снимок библиотеки: 152 вида / 1 240 изображений.

---

- [English](https://verdalia.app/en/accuracy.md)
- [Библиотека видов](https://verdalia.app/ru/species.md)
