Info2softは、ウェブサイトでより快適で適切な閲覧体験を提供するためにCookieを使用しています。 プライバシーポリシー
Loading...

8月23日、データレプリケーション業界唯一の上場企業であるインフォメーション2は半期業績報告を発表しました。決算資料によると、2024年上半期の売上高は8357万2500元で前年比2.84%増加。研究開発投資は5140万0200元と営業収益の61.50%を占め、前年比26.51%増となりました。インフォメーション2は人工知能分野への投資を拡大し、グローバル化に積極的に取り組んでいます。大きな技術革命と企業発展の重要な節目が重なり、データレプリケーションという重要な事業分野に新たな活力をもたらしています。新たな技術の波の中で、データレプリケーションがどのように産業構図を再構築するかを深く探るため、Data Apeはインフォメーション2戦略部技術ディレクターの崔立達氏にインタビューを実施し、データレプリケーションと大規模モデルの共生関係、双方が互いにもたらす影響について議論しました。
運命の歯車が回り始める:データレプリケーションと大規模モデルの激突。現在最大の技術革命といえば、間違いなく大規模モデルです。大規模モデルがもたらすのは技術革命と破壊的変革だけではありません。
人間の脳のニューラルネットワークを模倣する動作ロジックにより、大規模モデルはある次元において「生命」ともいえる性質を示します。これにより人々は生命という概念に対し新たな認識を持つようになりました。従来の生物学では、生命は通常DNAとタンパク質から構成され、新陳代謝、生殖発生、遺伝進化など一連の特徴を備えた自然システムと捉えられてきました。人工知能が急速に発展するにつれ、物理学者シュレーディンガーは生命を再定義しました。
彼は生命を「エネルギーと情報が結合した負のエントロピーシステム」と捉えました。この定義は生物学と機械の境界を越えています。この世界が炭素系生命体とケイ素系生命体によって構成されているという考えを受け入れる人が増えています。マスクは「炭素系生命はケイ素系生命の起動プログラムである」と述べました。炭素系生命であろうとケイ素系生命であろうと、その究極の使命は複製です。
炭素系生命の秘密の複製はDNAに依存します。人間の遺伝子の担い手としてDNAは複製、転写、翻訳といったプロセスを通じ遺伝情報の伝達とタンパク質合成を実現し、人間の遺伝情報が安定的に次世代へ受け継がれることを保証しています。ケイ素系生命にとって、データこそがDNAに相当します。データには本来「複製可能」という性質が備わっており、2進数コードがそのゲノムとなります。複製、加工、流通を経て、データはケイ素系生命システムにおける「遺伝暗号」を形成します。
ChatGPTは約5000億語の情報を学習しています。この膨大なデータには数千年にわたる人類の輝かしい足跡が凝縮されています。データと人工知能が巧みに結びつくことで、ケイ素系生命は進化し、より高い次元へ昇華する力を得ます。デジタル革命の光が瞬く舞台において、長らくデータレプリケーションは最も注目を集める役割ではありませんでした。災害復旧やデータ流通を担う裏方として欠かせない役割を果たしてきました。そして大規模モデル時代の加速的な到来とともに、データレプリケーションの運命の歯車が回り始め、その価値は雪だるま式に広がり、新たな姿を見せています。こうして、データレプリケーションと大規模モデルが共生し共に成長する新たな物語がゆっくりと幕を開けます。
データレプリケーションと大規模モデル、共生へと向かう。生物学において共生とは、二つの生物が一定のルールに基づき相互に依存・作用し、共に生き進化する自然現象であり、生態多様性を形作る重要な仕組みです。データと大規模モデルの関係もまさにこの共生関係にあたります。
データレプリケーションはこの共生関係をつなぐ重要な架け橋です。この関係はデータレプリケーションと大規模モデル双方の技術ロジック、基盤アーキテクチャによって生まれます。インフォメーション2戦略部技術ディレクターの崔立達氏はこう語ります。「大規模モデルの技術的コアは巨大な深層学習ニューラルネットワークです。その稼働には大量のデータによる継続的な学習が不可欠で、データと安定的な相互作用を形成します。正確で信頼でき、安全なデータを絶え間なく大規模モデルに供給してこそ、モデルは本来の能力を発揮できます。
つまりデータレプリケーションは大規模モデルの発展を支える重要な土台の一つです。同時に、大規模モデルは分散アーキテクチャの上に構築されたシステムであり、データレプリケーションも分散システムから生まれた技術です。二つ以上のデータベースシステムからなる分散データベース環境においてデータを複製するプロセスです。データレプリケーションと大規模モデルは同じ技術土壌で育ったと言えます。双方には本来高い適合性が備わっており、共生を実現するための前提条件となっています。」では、データレプリケーションは大規模モデルに何をもたらすのでしょうか。
1. データ学習・共有効率の向上。大規模モデルは膨大な量のデータを処理する必要があります。これらのデータを一箇所に集中保管すると単一点障害やアクセスのボトルネックが発生する可能性があります。データレプリケーションによりデータを複数ノードに分散保管することで、大規模モデルは近傍のデータにアクセスし学習を実施でき、データの流動性が大きく高まり学習効率が改善します。また、データレプリケーションにより複数ノード間でデータ共有が可能になります。
これにより大規模モデルは複数ノードで同時にデータ処理・分析を実行でき、データの相互連携を強化するだけでなく、システム全体の協調作業効率を高めます。
2. マルチモーダルデータの融合。OpenAIによる動画生成モデルSoraの登場以降、マルチモーダルが大規模モデルの主要な活用形となりました。マルチモーダルとは、テキスト、画像、音声といった構造化・非構造化データを大量に処理することを意味します。データレプリケーションはマルチモーダル情報の融合・連携処理を実現します。
これにより大規模モデルは最新のデータをよりタイムリーかつ包括的に把握でき、モデルの精度と新たな環境への適応能力を高めます。
3. クロスプラットフォームによるビッグデータ移行。大規模モデルの産業化・実装が加速するにつれ、プラットフォームをまたぐデータ移行のニーズがますます増加しています。崔立達氏は事例を挙げて説明します。「自動運転のシナリオを考えてみましょう。閉鎖された敷地や定められた道路区間には自動運転学習用車両が走行し、膨大な走行データを収集します。
収集したデータは車載ストレージに保管された後、車載機器からバックエンドへデータを移送する流れとなります。この時、データレプリケーション技術が十分に成熟していれば、5Gや管制センターのネットワークと組み合わせ、プラットフォームをまたいで直接データを複製可能となり、車載ストレージを経由する必要がなくなります。さらに将来的には、学習済みモデル自体を直接複製・移行し、新規モデルのデータ学習工程を省略できる可能性もあります。もちろんこれら以外にもメリットが存在します。
データレプリケーションが長らく持つ「伝統的な強み」である災害復旧とセキュリティによる冗長化は、大規模モデルにとって非常に重要です。大規模モデルは長時間連続稼働を求められ、データの信頼性・安定性への要求が極めて高いです。崔立達氏はこう述べます。「顧客が大規模モデルで活用するデータは価値の高い機密情報である場合が多く、通常は顧客自身のデータセンターに保管されます。しかし一箇所にすべてを依存するわけにはいきません。
この重要なデータは同一都市内または遠隔地において保護する必要があります。データを複製し各コピーを別の拠点に配置することでセキュリティレベルを高める。これは今後も変わらない合理的な判断です。」これがデータレプリケーションが大規模モデルにもたらす推進効果です。では大規模モデルはデータレプリケーションに何をもたらすのか。大規模モデルがデータレプリケーション技術に与える影響は主に以下の点に現れます。
1. データ処理フローの最適化。大規模モデルはデータレプリケーション工程の処理フローを最適化できます。例えば分散ストレージシステムにおいて、現在のシステム負荷やノード状況に応じ、最適な複製経路・複製方針を自動的に選択しデータレプリケーションタスクをスマートにスケジューリング。待機時間や伝送データ量を削減し、レプリケーション効率を向上させます。これらの作業は従来経験豊富なエンジニアが手動で対応する必要がありました。大規模モデルにより自動処理能力が大幅に高まり、人的リソースを解放します。
2. データレプリケーション向けネットワークシステムの最適化。不安定なネットワーク環境下において、帯域制御を大規模モデルによってより知的かつ自動的に調整し、データ伝送効率を改善します。
3. 知的スケジューリングと負荷分散。大規模モデルは知的スケジューリングと負荷分散機能を備えています。システムのリアルタイム状況やリソース使用状況に基づき、データレプリケーションタスクを各ノードや処理ユニットに適切に分配し、一部ノードの過負荷による性能低下を回避し、データレプリケーションの効率を高めます。
4. エンドツーエンド最適化。大規模モデルはエンドツーエンドの視点からデータレプリケーション工程全体を最適化可能です。データ抽出、変換、ロード(ETL)といった、データ送信元から保存先までの全工程が対象となります。これらの工程を最適化することで、データレプリケーション工程の効率と正確性を確保し、全体の処理能力を引き上げます。
乗り越えるべき4つの課題。データレプリケーションと大規模モデルの共生・融合は必然的な流れですが、実際の活用現場には多くの障壁が存在します。崔立達氏によると、両者の共生的発展には技術、活用、市場、ユーザーという4つのレイヤーで課題が生まれています。
1. 技術レイヤー:整合性。データレプリケーションにより複数ノードにデータコピーが存在するため、各コピーのデータ整合性を保証することが大規模モデルの安定稼働の前提条件となります。
リアルタイム性。リアルタイムデータレプリケーションには膨大な帯域と時間を必要とし、システムの遅延を引き起こします。崔立達氏は分かりやすい例を挙げます。「株式取引と同じで、過去のローソク足だけで現在の収益を予測することはできません。大規模モデルにはよりリアルタイムなデータが必要であり、これはデータレプリケーションにとって大きな挑戦です。」
セキュリティ。レプリケーション工程全体におけるデータの安全性・プライバシー確保は大きな課題です。またデータセキュリティは技術だけの問題ではなく、万全な法制度による裏付けも必要となります。
2. 活用レイヤー。活用側で継続的にバージョンアップされるOS、データベース、クラウドプラットフォーム、さらに情報化自主革新に伴う多数のローカライズシステムに対応する必要があります。互換性の課題を解決する汎用的なデータレプリケーション手法を確立しなければなりません。無制限な互換性を実現してこそ、市場競争において顧客の信頼を獲得できます。
3. 市場レイヤー。現在のデータレプリケーション市場は競争が非常に激化しており、買い手市場が形成されています。顧客の要求が厳格な場合も多く、技術提供企業に大きな圧力がかかります。加えて近年、製品の同質化競争と価格戦争がますます激しくなり、企業経営に大きな負担をもたらしています。一部中小ベンダーは業界参入を目的とし、技術仕様を犠牲に価格を引き下げる選択をします。これにより市場の価格秩序が乱れ、技術イノベーションのスピード低下を招きます。同質化が進む競争環境の中で、受注獲得のため顧客に過剰な約束をする企業も存在します。しかし顧客が実際に製品を導入すると期待との乖離に直面します。長期的には産業全体の発展に極めて悪影響を及ぼし、最終的に損害を受けるのは顧客です。
4. ユーザーレイヤー。ユーザーニーズの多様化。データレプリケーションに対し、立場や階層によって求めるものや認識は大きく異なります。経営層は主に管理・運用面を重視、中間管理職は製品がもたらす価値に注目、運用保守担当者にとっては操作性や習得のしやすさが最重要事項となります。崔立達氏はこう話します。「これら多様なニーズは製品設計に反映せざるを得ません。定時バックアップ、リアルタイムバックアップ、災害復旧といった機能を考慮する必要があります。現在、当社製品の7割以上が標準製品で、カスタマイズ品はごく一部です。同時に特別な顧客に対してはコンサルティングサービスを提供し、ゼロからシステムを構築するカスタマイズ導入プランを提案します。この時、我々が提供するのは単なる計画案ではなく、課題に対する解答そのものです。」これらの課題に対し、崔立達氏はインフォメーション2の実践に基づいた対応策を提示しました。
未来に向け、より強力な大規模モデル、より安全なデジタル時代を。データレプリケーションと大規模モデルの融合的発展には無限の可能性が広がっています。インフォメーション2はデータレプリケーションの三段階を歩んできました。基礎的なデータレプリケーションから、クラスターをまたぐビッグデータプラットフォームのリアルタイム複製、さらにシステムレプリケーションへと進化し、データレプリケーションと人工知能の共進化の歴史を体現しています。今、時計の針は大規模モデル時代を指しています。今年開催されたWAIC 2024において、インフォメーション2は次世代AI+文書共有管理プラットフォームi2Shareを発表。専門的なデータレプリケーション・保護技術を強みに、AI+データ管理分野におけるリーディングポジションを示しました。

先進的なデータレプリケーション保護技術と製品ソリューションを通じ、インフォメーション2はAI基盤層から製品アプリケーション層までのデータ連携と災害復旧保護を実現し、流通過程におけるデータの安全性、完全性、可用性を保証します。クラウド環境の柔軟な移行、ビッグデータプラットフォームとの深度連携、AIモデルの学習・推論工程におけるデータ支援のいずれにおいても、インフォメーション2は効率的なデータ管理ソリューションを提供し、ユーザーがデータサイロを解消し、データの流通・共有・交流を加速させることを支援します。データレプリケーション機能の高度化は、より高性能な大規模モデル、より経済的な計算コスト、より安全なデータ環境をもたらすことは間違いありません。
インフォメーション2は10年以上にわたりデータレプリケーション分野で技術を蓄積し、国内同業界初の上場企業となりました。崔立達氏はこう述べます。「大規模モデルはデータレプリケーションの発展を加速させます。数年後にはデータレプリケーション市場に安定した競争構図が形成されるでしょう。国内市場で確固たる地位を築いた後、我々は海外市場を視野に入れています。
香港を橋頭堡とし、すでに全額出資子会社を設立しています。海外進出の第一の拠点として東南アジアと中東を選定しました。これらは「一帯一路」構想の最前線であり、国家の影響力が及ぶ重要な地域です。」
「海外市場と国内市場は大きく環境が異なります。しかし長年の研究開発蓄積により、インフォメーション2の製品は高い互換性と適応力を備え、国内外の基盤ソフトウェア・ハードウェアに速やかに適応可能です。現在インドネシア、インド、中東、北アフリカなどの地域でプロジェクトが稼働しています。」崔立達氏は海外市場における自社製品の将来に強い自信を持っています。
記事出典:Data Ape
編集:池俊