検索エンジンの内部文書流出騒動が残した最大の教訓は、エンティティ認識の厳格化だった。検索巨大企業が裏側で稼働させる巨大データベース、Google ナレッジグラフは、ウェブページ上の固有名詞を単なるテキストではなく「固有の存在」として網の目のように結びつけている。
独自に入手した内部アルゴリズムの解析データによれば、評価スコアの大部分は「未定義の概念」ではなく「既知の信頼されたエンティティ」との距離感に依存している。ページ内に独自の人物名、商標、製品名、あるいは権威ある組織名が正しく構造化されて埋め込まれているかどうかが、検索順位の初動を決定づけるトリガーになっているのだ。無難な一般名詞だけで構築された記事は、どれほど長文であっても評価モデルのフィルターを通過できない。